AI News

Похоже, что ИИ-агенты на OpenRouter теперь потребляют больше токенов, чем человеческие пользователи, что означает сдвиг в том, как формируется и оплачивается спрос на модельный инференс. Это важно, потому что ИИ-системы все чаще производят работу для других ИИ-систем, а не только обслуживают прямые человеческие запросы.

Согласно материалу The Decoder со ссылкой на аналитика OpenRouter Питера Уокера, 6 февраля 2026 года мог быть последним днем на платформе, когда люди потребляли больше токенов, чем агенты. С тех пор использование токенов агентами выросло в 14 раз, тогда как человеческое потребление увеличилось в 2,8 раза.

Эти цифры указывают на быстро расширяющийся класс нагрузок, в котором одна модель вызывает другую, работает дольше или запускает дополнительные процессы ИИ. Однако это не означает, что расходы на инференс выросли в той же пропорции. Значительная часть измеренного использования состоит из повторяющегося контекста, обслуживаемого из более дешевых кэшированных промптов.

Что показывают данные OpenRouter

Ключевой показатель — сравнение потребления токенов при использовании, инициируемом людьми, и при использовании, инициируемом агентами, на OpenRouter. The Decoder сообщил, что после 6 февраля агенты обогнали людей по общему потреблению токенов, основываясь на анализе Уокера. В отчете не приводится исходный график, абсолютные значения токенов или подробное определение того, как OpenRouter классифицирует агентский трафик.

Тем не менее, сообщаемые темпы роста остаются значительными. Рост агентского использования в 14 раз по сравнению с ростом человеческого использования в 2,8 раза указывает на то, что автономные или полуавтономные рабочие процессы на платформе расширяются быстрее, чем обычные чат-бот-взаимодействия.

Этот результат следует рассматривать как сигнал платформы, а не как полный показатель рынка ИИ. Сообщается, что трафик OpenRouter смещен в сторону open-weight моделей, которые, по данным The Decoder, обычно менее эффективны по токенам, чем модели OpenAI или Anthropic. Пользователи таких моделей могут, следовательно, генерировать больше токенов для сопоставимых задач, делая смесь платформы отличной от закрытых модельных провайдеров.

Рост токенов — это не то же самое, что рост затрат

Почти 70% потребления токенов агентами, как сообщается, приходится на кэшированные промпты. Кэширование позволяет выставлять счет за повторяющиеся инструкции или контекст по значительно более низким тарифам, чем за недавно обработанный ввод, поэтому общий объем токенов может расти намного быстрее, чем фактические расходы на инференс.

Это различие важно для продуктовых команд, планирующих внедрение агентов. Рабочий процесс, который выглядит дорогим, если измерять его только по токенам, может иметь приемлемый счет, если большая часть контекста эффективно переиспользуется. И наоборот, команды, считающие кэш гарантом, могут столкнуться с более высокими затратами, если промпты часто меняются, доля попаданий в кэш снижается или агенты генерируют большие объемы нового вывода.

Данные также подчеркивают проблему измерения. Подсчет токенов показывает, сколько контекста модели было обработано, но не обязательно, сколько полезной работы было выполнено. Агент, который многократно возвращается к тем же инструкциям или вызывает несколько моделей, прежде чем прийти к ответу, может создавать значительное потребление без пропорционального улучшения качества.

Почему агенты стимулируют спрос

Агентские рабочие процессы, как правило, потребляют больше токенов, чем однократные диалоги, потому что они сохраняют состояние, проверяют промежуточные результаты, вызывают инструменты и пересматривают планы. Они также могут делегировать подзадачи отдельным экземплярам модели. Каждый шаг может добавлять контекст, результаты инструментов, следы рассуждений или инструкции в следующий запрос.

The Decoder связал рост с тем, что агенты дольше работают автономно и запускают дополнительные процессы ИИ. Такое поведение соответствует более широкому переходу от чат-интерфейсов к системам, выполняющим многошаговые задачи, хотя доступные данные не позволяют установить, какие именно приложения или отрасли стоят за ростом OpenRouter.

В отчете также эта тенденция сопоставляется с ростом моделей рассуждения. Такие системы могут использовать больше внутренней обработки до выдачи ответа, увеличивая потребление токенов даже при коротком запросе пользователя. The Decoder назвал это источником «инфляции токенов», но имеющиеся данные не показывают, какая часть роста агентского использования на OpenRouter связана с моделями рассуждения, а какая — с более длительной оркестрацией.

Последствия для разработчиков и корпоративных покупателей

Для разработчиков ИИ главный вывод заключается в том, что один только выбор модели не определяет эксплуатационные расходы. Архитектура агента столь же важна. Командам необходимо отслеживать коэффициент попаданий в кэш, размер контекста, частоту вызовов инструментов, поведение повторных попыток и число вызовов модели на одну завершенную задачу.

Еще одна проблема — надежность. Долго работающие агенты создают больше возможностей для накопления неверных предположений, неудачных вызовов инструментов или ненужных циклов. Система, дешевая по запросу, все равно может стать дорогой, если работает без жестких ограничений. Бюджеты, тайм-ауты выполнения, этапы утверждения и четкие условия остановки, вероятно, будут не менее важны, чем качество промпта.

Корпоративным покупателям следует запрашивать у поставщиков метрики на уровне рабочих процессов, а не только громкие цены на модели. Полезные вопросы включают: сколько вызовов делает агент на задачу, какая часть трафика выигрывает от кэширования, как измеряется использование между делегированными агентами и могут ли клиенты устанавливать лимиты расходов или выполнения.

Важен и рыночный эффект. Если ИИ все чаще создает спрос на ИИ, поставщики моделей могут продавать не только людям, но и программным системам, которые непрерывно потребляют инференс. Это может поддерживать большие объемы использования, одновременно усиливая давление на провайдеров с целью улучшения кэширования, оркестрации, задержек и прозрачности ценообразования.

За чем следить дальше

Первый сигнал, за которым стоит наблюдать, — сообщат ли другие крупные модельные платформы о похожем пересечении между человеческим и агентским использованием. Трафик OpenRouter, ориентированный на open-weight модели, является полезным свидетельством, но не окончательным рыночным ориентиром.

Во-вторых, разработчикам следует искать более полные данные о расходах. Показатель в 70% кэшированных промптов объясняет, почему рост токенов может завышать траты, но не раскрывает общую выручку, среднюю стоимость на задачу или долю некэшированного вывода. Эти метрики показали бы, действительно ли агенты существенно расширяют платный инференс или в основном увеличивают дешевую обработку контекста.

В-третьих, заявления о принятии технологии следует проверять по завершению задач и удержанию пользователей. Рост токенов может отражать и продуктивную автономную работу, и неэффективный промптинг, и то и другое. Данные об успешных задачах, вмешательстве человека и повторном использовании будут информативнее, чем один лишь объем.

Наконец, важна реакция провайдеров моделей. Улучшения кэширования контекста, более маленькие специализированные модели и более эффективное рассуждение могут снизить стоимость роста агентских систем. В то же время провайдеры могут ввести цены и ограничения, специально рассчитанные на спрос между программными системами.

Взгляд Creati.ai

Сообщаемые OpenRouter цифры отражают важное изменение в экономике ИИ: самым быстрорастущим пользователем модели может быть другая модель. Но это по-прежнему сигнал, специфичный для платформы, основанный на комментариях аналитика, а не независимо проверенная перепись активности агентов по всей отрасли.

Для команд, внедряющих ИИ-агентов, практический приоритет — измерять полезную работу на доллар, а не только токены. Рост агентов может расширить адресуемый рынок инференса, но устойчивое внедрение будет зависеть от контроля циклов, доказательства надежности задач и понимания того, когда кэширование действительно снижает стоимость автономного выполнения.

Рекомендуемые

ИИ становится крупнейшим клиентом ИИ на фоне резкого роста использования токенов агентами на OpenRouter

Данные OpenRouter показывают, что ИИ-агенты теперь потребляют больше токенов, чем люди, заставляя разработчиков пересматривать стоимость, пропускную способность и надежность по мере роста агентских нагрузок.