AI News

Los agentes de IA podrían estar consumiendo ahora más tokens que los usuarios humanos en OpenRouter, lo que marca un cambio en cómo se genera y se paga la demanda de inferencia de modelos. El cambio importa porque los sistemas de IA están produciendo cada vez más trabajo para otros sistemas de IA, en lugar de atender solo a los prompts humanos directos.

Según un informe de The Decoder, citando al analista de OpenRouter Peter Walker, el 6 de febrero de 2026 podría haber sido el último día en la plataforma en que los humanos consumieron más tokens que los agentes. El uso de tokens por parte de agentes ha aumentado 14 veces desde entonces, mientras que el uso humano ha crecido 2,8 veces.

Las cifras apuntan a una clase de cargas de trabajo en rápida expansión en la que un modelo llama a otro, continúa operando durante más tiempo o запуска procesos adicionales de IA. Sin embargo, no significan que el gasto en inferencia haya aumentado en la misma proporción. Gran parte del uso medido consiste en contexto repetido servido desde prompts cacheados más baratos.

Qué muestran las cifras de OpenRouter

El dato central es una comparación entre el consumo de tokens por uso impulsado por humanos y por uso impulsado por agentes en OpenRouter. The Decoder informó que los agentes superaron a los humanos en el consumo total de tokens después del 6 de febrero, basándose en el análisis de Walker. El informe no proporciona el gráfico subyacente, los totales absolutos de tokens ni una definición detallada de cómo clasifica OpenRouter el tráfico agente.

Aun así, las tasas de crecimiento informadas siguen siendo significativas. Un aumento de 14x en el uso de agentes frente a un crecimiento de 2,8x en el uso humano sugiere que los flujos de trabajo autónomos o semiautónomos se están expandiendo más rápido que las interacciones convencionales de chatbot en la plataforma.

El resultado debe leerse como una señal de la plataforma, no como una medida completa del mercado de la IA. Según se informa, el tráfico de OpenRouter se inclina hacia modelos de pesos abiertos, que The Decoder dice que en general son menos eficientes en tokens que los modelos de OpenAI o Anthropic. Por lo tanto, los usuarios de esos modelos pueden generar más tokens para tareas comparables, lo que hace que la mezcla de la plataforma sea diferente de la de los proveedores de modelos cerrados.

El crecimiento de tokens no es lo mismo que el crecimiento de costes

Según se informa, casi el 70 % del consumo de tokens de agentes proviene de prompts cacheados. El almacenamiento en caché permite facturar instrucciones o contexto repetidos a tarifas sustancialmente más bajas que la entrada recién procesada, por lo que los totales brutos de tokens pueden crecer mucho más rápido que los costes reales de inferencia.

Esta distinción es importante para los equipos de producto que planifican despliegues de agentes. Un flujo de trabajo que parece caro cuando se mide solo por tokens puede tener una factura manejable si la mayor parte de su contexto se reutiliza de forma eficiente. Por el contrario, los equipos que traten el caché como una garantía podrían enfrentarse a costes más altos cuando los prompts cambian con frecuencia, los aciertos de caché disminuyen o los agentes generan grandes cantidades de salida nueva.

Los datos también ponen de relieve un problema de medición. Los conteos de tokens capturan cuánto contexto del modelo se procesa, pero no necesariamente cuánto trabajo útil se completa. Un agente que revisa repetidamente las mismas instrucciones o llama a varios modelos antes de llegar a una respuesta puede generar un uso considerable sin ofrecer una mejora proporcional en la calidad.

Por qué los agentes impulsan la demanda

Los flujos de trabajo con agentes suelen consumir más tokens que las conversaciones de un solo turno porque conservan el estado, inspeccionan resultados intermedios, llaman a herramientas y revisan planes. También pueden delegar subtareas a instancias de modelo separadas. Cada paso puede añadir contexto, salida de herramientas, trazas de razonamiento o instrucciones a la siguiente solicitud.

The Decoder vinculó el aumento con agentes que trabajan de forma independiente durante más tiempo y generan procesos adicionales de IA. Ese comportamiento es coherente con un movimiento más amplio desde las interfaces de chat hacia sistemas que ejecutan tareas de varios pasos, aunque la evidencia disponible no establece qué aplicaciones o sectores específicos explican el crecimiento de OpenRouter.

El informe también sitúa la tendencia junto al auge de los modelos de razonamiento. Estos sistemas pueden usar más procesamiento interno antes de devolver una respuesta, lo que incrementa el consumo de tokens incluso cuando la solicitud del usuario es corta. The Decoder caracterizó esto como una fuente de “inflación de tokens”, pero la evidencia disponible no muestra cuánto del crecimiento de los agentes en OpenRouter proviene de modelos de razonamiento frente a una orquestación de mayor duración.

Implicaciones para creadores y compradores empresariales

Para los creadores de IA, la lección inmediata es que la selección del modelo por sí sola no determinará los costes operativos. La arquitectura del agente es igualmente importante. Los equipos tendrán que vigilar las tasas de acierto del caché, el tamaño del contexto, la frecuencia de llamadas a herramientas, el comportamiento de reintentos y el número de llamadas al modelo necesarias por tarea completada.

La fiabilidad es otra preocupación. Los agentes de ejecución más larga crean más oportunidades para que una suposición incorrecta, una llamada fallida a una herramienta o un bucle innecesario se acumulen. Un sistema barato por solicitud puede seguir siendo costoso cuando funciona sin límites firmes. Es probable que los presupuestos, los tiempos de espera de ejecución, las puertas de aprobación y las condiciones claras de parada sean tan importantes como la calidad del prompt.

Los compradores empresariales deberían pedir a los proveedores métricas a nivel de flujo de trabajo en lugar de precios de modelos llamativos. Las preguntas útiles incluyen cuántas llamadas realiza un agente por tarea, qué parte del tráfico se beneficia del caché, cómo se mide el uso entre agentes delegados y si los clientes pueden imponer límites de gasto o de ejecución.

La implicación de mercado también es notable. Si la IA genera cada vez más demanda para la IA, los proveedores de modelos podrían estar vendiendo no solo a usuarios humanos, sino a sistemas de software que consumen inferencia continuamente. Eso podría sostener grandes volúmenes de uso, al tiempo que aumenta la presión sobre los proveedores para mejorar el caché, la orquestación, la latencia y la transparencia de precios.

Qué vigilar a continuación

La primera señal a vigilar es si otras grandes plataformas de modelos informan de un cruce similar entre uso humano y uso de agentes. El tráfico de OpenRouter, intensivo en modelos de pesos abiertos, es una evidencia útil, pero no una referencia definitiva para todo el mercado.

En segundo lugar, los creadores deberían buscar datos de costes más completos. La cifra del 70 % de prompts cacheados explica por qué el crecimiento de tokens puede exagerar el gasto, pero no revela los ingresos totales, el coste medio por tarea ni la proporción de salida no cacheada. Esas medidas mostrarían si los agentes están expandiendo de forma material la inferencia de pago o si solo están aumentando el procesamiento de contexto de bajo coste.

En tercer lugar, las afirmaciones de adopción deberían contrastarse con la finalización de tareas y la retención. El aumento de tokens puede reflejar trabajo autónomo productivo, prompting ineficiente o ambos. La evidencia sobre tasas de tareas exitosas, intervención humana y uso repetido sería más informativa que el volumen por sí solo.

Por último, importará la respuesta de los proveedores de modelos. Las mejoras en el caché de contexto, los modelos especializados más pequeños y un razonamiento más eficiente podrían reducir el coste del crecimiento de los agentes. Al mismo tiempo, los proveedores podrían introducir precios y controles diseñados específicamente para la demanda de software a software.

Perspectiva de Creati.ai

Las cifras informadas de OpenRouter capturan un cambio importante en la economía de la IA: el usuario de un modelo que crece más rápido puede ser otro modelo. Pero la evidencia sigue siendo una señal específica de la plataforma basada en comentarios de analistas, no un censo verificado de forma independiente de la actividad de agentes en toda la industria.

Para los equipos que despliegan agentes de IA, la prioridad práctica es medir el trabajo útil por dólar, no solo los tokens. El crecimiento de los agentes puede ampliar el mercado potencial de la inferencia, pero un despliegue sostenible dependerá de controlar los bucles, demostrar la fiabilidad de las tareas y entender cuándo el caché reduce realmente el coste de la ejecución autónoma.

Destacados

La IA se convierte en el mayor cliente de la IA mientras se dispara el uso de tokens de agentes en OpenRouter

Los datos de OpenRouter sugieren que los agentes de IA ahora consumen más tokens que los humanos, obligando a los creadores a replantearse el coste, la capacidad y la fiabilidad a medida que crecen las cargas de trabajo de los agentes.