Сообщается, что ИИ-агенты используют в пять раз больше токенов, чем люди, но данные неясны

Сообщаемый пятикратный разрыв в использовании токенов между ИИ-агентами и людьми указывает на рост затрат на инференс, однако исходные данные по-прежнему недоступны.

AI News

В заголовке, распространяемом через Yahoo Finance и 24/7 Wall St., сообщается, что ИИ-агенты потребляют в пять раз больше токенов, чем люди, и что разрыв продолжает увеличиваться. Если эта тенденция подтвердится, она будет указывать на быстро меняющуюся структуру затрат программного обеспечения, созданного на основе больших языковых моделей: автономные системы могут генерировать и обрабатывать значительно больше выходных данных модели, чем люди создают напрямую.

Однако доступные публикации не содержат исходного текста статьи, набора данных, методологии, периода измерений или названной организации, стоящей за сравнением. Поэтому показатель «в пять раз» остается сообщаемым утверждением, а не независимо проверяемой отраслевой статистикой. Эта новость по-прежнему важна для разработчиков ИИ и корпоративных покупателей, но главный вопрос заключается не просто в том, используют ли агенты больше токенов. Важно понять, как эти токены генерируются, какие задачи их требуют и создает ли дополнительная работа модели достаточную ценность, чтобы оправдать ее стоимость и операционные риски.

Что может означать сообщаемый пятикратный разрыв

В приложении с ИИ токен представляет собой единицу текста, обрабатываемую языковой моделью. Потребление токенов может расти, когда система получает длинные инструкции, извлекает документы, сохраняет историю разговора, вызывает инструменты, повторяет неудачные действия или просит модель проверить и переработать собственную работу. Поэтому ИИ-агент может создавать гораздо больше взаимодействий с моделью, чем человек, отправляющий один запрос через чат-интерфейс.

Заголовки обоих изданий описывают сравнение между ИИ-агентами и людьми. Однако они не уточняют, означает ли слово «человек» пользователей чат-ботов, сотрудников, выполняющих тот же рабочий процесс без ИИ, или другую категорию пользователей. Также не сообщается, измеряет ли пятикратная разница входные токены, выходные токены или и то и другое.

Эти различия важны. Помощник по программированию может использовать большие контекстные окна, выдавая при этом относительно короткие ответы. Исследовательский агент может многократно искать, обобщать, сравнивать и проверять информацию. Агент службы поддержки может выполнить несколько скрытых вызовов модели, прежде чем показать пользователю короткий ответ. Объединение таких моделей поведения в одно число способно скрыть существенные различия между продуктами и задачами.

Доказательств недостаточно для подтверждения утверждения

Yahoo Finance и 24/7 Wall St. публикуют один и тот же основной заголовок, отличающийся лишь знаком препинания, но предоставленные исходные материалы не содержат полного текста статьи. Ни один фрагмент источника не называет исследователей, компанию, бенчмарк, размер выборки, поставщиков моделей или период измерений, на которых основано утверждение.

Поэтому показатель «в пять раз» не следует считать подтвержденным бенчмарком. В доступных материалах также нет доказательств того, что сообщаемое увеличение разрыва измерялось на всем рынке ИИ-агентов. Возможно, речь идет о конкретной платформе, группе клиентов, рабочем процессе или внутреннем анализе.

Это ограничение особенно важно, поскольку использование токенов зависит от выбора модели и архитектуры приложения. Система, использующая небольшую модель для обычной классификации, будет иметь иной профиль, чем система, направляющая каждый шаг к передовой модели. Аналогично, агента, настроенного на остановку после одного вызова инструмента, нельзя напрямую сравнивать с агентом, предназначенным для планирования, выполнения, проверки результатов и повторных попыток до завершения задачи.

Таким образом, публикации поддерживают лишь узкий вывод: СМИ обращают внимание на заявленный рост потребления токенов ИИ-агентами. Они пока не позволяют точно оценить использование на уровне всего рынка и не доказывают, что агенты становятся экономически неэффективными.

Почему этот показатель важен для разработчиков и покупателей

Для продуктовых команд больший расход токенов означает не только более высокий счет за модели. Он может влиять на задержку ответа, ограничения частоты запросов, планирование инфраструктуры, наблюдаемость и надежность многоэтапных рабочих процессов. Система, которая незаметно расширяет контекст или повторяет действия, может сохранять точность, но стать слишком медленной или дорогой для эксплуатации в production.

Командам, создающим ИИ-агентов, следует измерять токены на уровне рабочего процесса, а не только на каждый пользовательский запрос. Полезные показатели включают количество токенов на выполненную задачу, число вызовов модели на успешный результат, частоту повторных попыток, долю неудачных вызовов инструментов и долю работы, выполняемой разными моделями. Эти показатели позволяют понять, улучшает ли дополнительное рассуждение выполнение задачи или лишь создает больше активности.

Корпоративные покупатели сталкиваются с похожей проблемой. Короткий ответ в интерфейсе может скрывать гораздо более длинную последовательность вызовов модели. Команды закупок и финансов должны спрашивать поставщиков, как учитывается использование, включаются ли фоновые вызовы и как меняются затраты при росте числа пользователей, документов, инструментов и сохраняемого контекста.

Сообщаемая тенденция также поднимает вопрос о дизайне продукта. Системы на основе агентов часто рекламируются через автономность, но автономность может требовать большего планирования и проверки. Поэтому правильное сравнение — это не только объем токенов. Важно сравнивать стоимость и качество выполнения определенного бизнес-процесса с существующим программным обеспечением, человеческим трудом или более простым ИИ-процессом.

Значение для рынка: эффективность становится свойством продукта

Если агенты потребляют больше токенов, чем люди, а разрыв увеличивается, эффективность моделей станет ключевым фактором конкуренции. Разработчики могут предпочесть небольшие модели для маршрутизации и извлечения данных, оставлять более мощные модели для сложных решений и ограничивать контекст информацией, которая непосредственно влияет на задачу.

К другим мерам относятся кэширование повторяющихся инструкций, суммирование длинных историй, ограничение ненужных вызовов инструментов и установка явных бюджетов на планирование и повторные попытки. Эти методы могут уменьшить потери, но способны создавать компромиссы. Агрессивное сжатие контекста может удалить полезные свидетельства, а строгие ограничения токенов могут заставить агента остановиться до проверки собственной работы.

Для платформенных компаний прозрачная отчетность об использовании может стать не менее важной, чем заявленное качество модели. Клиенты должны понимать, достигает ли агент лучших результатов или просто генерирует больше инференс-активности. Бенчмарк, предоставленный поставщиком и измеряющий токены без учета успешного выполнения задач, дает неполную картину.

Это утверждение важно и для конкуренции между поставщиками моделей. По мере того как ИИ-агенты будут обрабатывать более длинные рабочие процессы, преимущество могут получить поставщики, способные выдавать надежные результаты с меньшим числом вызовов или с более дешевыми моделями. Однако доступные источники не называют поставщика, продукт или модель, обладающих таким преимуществом сейчас.

За чем следить дальше

Первый сигнал для последующей проверки — исходный источник оценки «в пять раз». Надежное обновление должно указать, кто собирал данные, что считается агентом, как измерялось человеческое использование и подсчитывались ли входные и выходные токены отдельно.

Второй — знаменатель: токены на пользователя, разговор, задачу или успешный результат дают совершенно разные выводы. Покупателям также следует искать показатели, разбитые по рабочему процессу, модели и уровню автоматизации, а не одно среднее значение для всего рынка.

Наконец, необходимо искать доказательства связи между большим расходом токенов и бизнес-результатами. Такие показатели, как доля выполненных задач, сокращение ошибок, сэкономленное время и общая стоимость решения одной задачи, покажут, отражает ли повышенное потребление продуктивное рассуждение или неэффективный дизайн системы.

Взгляд Creati.ai

Сообщаемый пятикратный разрыв — полезное предупреждение, но пока не надежный бенчмарк. С учетом доступных свидетельств наиболее обоснованный вывод заключается в том, что ИИ-агенты могут создавать новый скрытый уровень спроса на модели, который не отражается в традиционных метриках использования чат-ботов.

Для разработчиков и предприятий практический ответ — измерять, а не паниковать. Нужно отслеживать весь рабочий процесс агента, связывать потребление токенов с успешными результатами и требовать от поставщиков раскрывать порядок тарификации фонового инференса. Пока исходные данные не опубликованы, утверждение о растущем разрыве должно помогать формулировать вопросы об экономике внедрения, а не давать окончательные ответы.

Реклама