La supuesta brecha de cinco veces en el uso de tokens entre los agentes de IA y los usuarios humanos pone de relieve el aumento de los costes de inferencia, pero los datos subyacentes siguen sin estar disponibles.

Un titular que circula por Yahoo Finance y 24/7 Wall St. informa de que los agentes de IA consumen cinco veces más tokens que los usuarios humanos y que la brecha continúa creciendo. Si se confirma, la tendencia apuntaría a un perfil de costes en rápida transformación para el software creado en torno a grandes modelos de lenguaje: los sistemas autónomos podrían generar y procesar considerablemente más resultados del modelo que las personas directamente.
Sin embargo, la información disponible no incluye el texto del artículo original, el conjunto de datos, la metodología, el periodo analizado ni la organización identificada detrás de la comparación. Esto convierte la cifra de cinco veces en una afirmación difundida por los medios, no en una estadística del sector verificable de forma independiente. La noticia sigue siendo relevante para los desarrolladores de IA y los compradores empresariales, pero la pregunta más importante no es simplemente si los agentes usan más tokens. Es cómo se generan esos tokens, qué tareas los requieren y si el trabajo adicional del modelo produce suficiente valor para justificar su coste y riesgo operativo.
En una aplicación de IA, un token representa una unidad de texto procesada por un modelo de lenguaje. El consumo de tokens puede aumentar cuando un sistema recibe instrucciones largas, recupera documentos, conserva el historial de una conversación, llama a herramientas, reintenta acciones fallidas o pide a un modelo que revise y modifique su propio trabajo. Por tanto, un agente de IA puede crear muchas más interacciones con el modelo que una persona que realiza una sola solicitud en una interfaz de chat.
El titular de ambos medios presenta la comparación entre agentes de IA y humanos. No establece si “humano” se refiere a personas que usan chatbots, empleados que completan el mismo flujo de trabajo sin IA u otra categoría de usuario. Tampoco indica si la diferencia de cinco veces mide tokens de entrada, tokens de salida o ambos.
Estas distinciones importan. Un asistente de programación puede consumir grandes ventanas de contexto y producir respuestas relativamente breves. Un agente de investigación puede buscar, resumir, comparar y validar información repetidamente. Un agente de atención al cliente puede generar varias llamadas ocultas al modelo antes de presentar una respuesta breve al usuario. Agregar estos patrones en una sola cifra puede ocultar diferencias importantes entre productos y tareas.
Yahoo Finance y 24/7 Wall St. publican el mismo titular principal, con la única diferencia de un signo de puntuación, pero el material de fuente proporcionado no contiene el texto completo del artículo. Ningún extracto identifica a los investigadores, la empresa, la referencia de evaluación, el tamaño de la muestra, los proveedores de modelos ni el periodo de medición en que se basa la afirmación.
Por ello, la cifra de cinco veces no debería tratarse como una referencia confirmada. Tampoco hay pruebas en el material disponible de que la ampliación de la brecha se haya medido en todo el mercado de agentes de IA. Podría describir una plataforma concreta, un grupo de clientes, un flujo de trabajo o un análisis interno.
Esta limitación es especialmente importante porque el uso de tokens varía según el modelo elegido y el diseño de la aplicación. Un sistema que utilice un modelo más pequeño para la clasificación rutinaria tendrá un perfil diferente del de uno que dirija cada paso a un modelo de frontera. Del mismo modo, un agente configurado para detenerse después de una llamada a una herramienta no puede compararse directamente con otro diseñado para planificar, ejecutar, inspeccionar los resultados y reintentar hasta completar una tarea.
Por tanto, la información publicada respalda una conclusión limitada: los medios están destacando un supuesto aumento del consumo de tokens por parte de los agentes de IA. Todavía no permite realizar una estimación precisa del uso en todo el mercado ni demuestra que los agentes se estén volviendo económicamente ineficientes.
Para los equipos de producto, un mayor uso de tokens se traduce en algo más que una factura de modelos más elevada. Puede afectar a la latencia de respuesta, los límites de frecuencia, la planificación de la infraestructura, la observabilidad y la fiabilidad de los flujos de trabajo de varios pasos. Un sistema que amplía silenciosamente su contexto o reintenta acciones puede mantener la precisión y, aun así, volverse demasiado lento o caro para el uso en producción.
Los equipos que desarrollan agentes de IA deberían medir los tokens a nivel del flujo de trabajo, no solo por solicitud del usuario. Entre las métricas útiles se incluyen los tokens por tarea completada, las llamadas al modelo por resultado satisfactorio, la frecuencia de reintentos, las tasas de fallo de las llamadas a herramientas y la proporción de trabajo gestionada por distintos modelos. Estas medidas pueden mostrar si el razonamiento adicional mejora la finalización de las tareas o simplemente genera más actividad.
Los compradores empresariales afrontan un reto relacionado. Una respuesta breve en una interfaz puede ocultar una secuencia mucho mayor de llamadas al modelo. Los equipos de compras y finanzas deberían preguntar a los proveedores cómo se contabiliza el uso, si se incluyen las llamadas en segundo plano y cómo cambian los costes a medida que aumentan el número de usuarios, documentos, herramientas y contexto conservado.
La tendencia señalada también plantea una cuestión de diseño de producto. Los sistemas agénticos suelen promocionarse por su autonomía, pero la autonomía puede requerir más planificación y verificación. Por tanto, la comparación adecuada no es solo el volumen de tokens. Es el coste y la calidad de completar un proceso empresarial definido frente al software existente, el trabajo humano o un flujo de IA más sencillo.
Si los agentes consumen más tokens que los usuarios humanos y la brecha se amplía, la eficiencia de los modelos se convertirá en un factor competitivo central. Los desarrolladores podrían preferir modelos más pequeños para el enrutamiento y la extracción, reservar modelos más capaces para decisiones difíciles y limitar el contexto a la información que afecta directamente a la tarea.
Otros controles incluyen almacenar en caché instrucciones repetidas, resumir historiales largos, limitar las llamadas innecesarias a herramientas y establecer presupuestos explícitos para la planificación y los reintentos. Estas técnicas pueden reducir el desperdicio, pero también introducir compensaciones. Una compresión agresiva del contexto puede eliminar pruebas útiles, mientras que unos límites estrictos de tokens pueden hacer que un agente se detenga antes de verificar su trabajo.
Para las empresas de plataformas, informar de forma transparente sobre el uso podría llegar a ser tan importante como la calidad anunciada del modelo. Los clientes necesitan saber si un agente está logrando mejores resultados o simplemente generando más actividad de inferencia. Una referencia comunicada por un proveedor que mida tokens sin medir la finalización satisfactoria de las tareas ofrecería una imagen incompleta.
La afirmación también es relevante para la competencia entre proveedores de modelos. A medida que los agentes de IA gestionen flujos de trabajo más largos, los proveedores capaces de ofrecer resultados fiables con menos llamadas o modelos de menor coste podrían obtener una ventaja. Sin embargo, las fuentes disponibles no identifican a ningún proveedor, producto o modelo que tenga actualmente tal ventaja.
La primera señal de seguimiento es la fuente original de la estimación de cinco veces. Una actualización creíble debería identificar quién recopiló los datos, qué se considera un agente, cómo se midió el uso humano y si los tokens de entrada y salida se contabilizaron por separado.
La segunda es el denominador: tokens por usuario, por conversación, por tarea o por resultado satisfactorio producen conclusiones muy distintas. Los compradores también deberían buscar cifras desglosadas por flujo de trabajo, modelo y nivel de automatización, en lugar de un único promedio de todo el mercado.
Por último, hay que buscar pruebas que relacionen un mayor uso de tokens con resultados empresariales. Medidas como la tasa de finalización, la reducción de errores, el tiempo ahorrado y el coste total por tarea resuelta mostrarían si el mayor consumo refleja un razonamiento productivo o un diseño ineficiente del sistema.
La supuesta brecha de cinco veces es una advertencia útil, pero todavía no una referencia fiable. Con las pruebas disponibles, la interpretación más sólida que puede defenderse es que los agentes de IA podrían estar creando una nueva capa de demanda de modelos oculta que las métricas convencionales de uso de chatbots no consiguen captar.
Para desarrolladores y empresas, la respuesta práctica es medir, no alarmarse. Hay que seguir todo el flujo de trabajo del agente, relacionar el consumo de tokens con los resultados satisfactorios y exigir a los proveedores que expliquen cómo se factura la inferencia en segundo plano. Hasta que se publiquen los datos subyacentes, la afirmación de una brecha creciente debería servir para orientar las preguntas sobre la economía del despliegue, no para resolverlas.