L’écart annoncé, cinq fois supérieur, entre la consommation de tokens des agents d’IA et celle des utilisateurs humains met en évidence la hausse des coûts d’inférence, mais les données sous-jacentes restent indisponibles.

Un titre relayé par Yahoo Finance et 24/7 Wall St. affirme que les agents d’IA consomment cinq fois plus de tokens que les utilisateurs humains, et que l’écart continue de se creuser. Si cette tendance était confirmée, elle indiquerait une évolution rapide de la structure de coûts des logiciels conçus autour des grands modèles de langage : les systèmes autonomes pourraient générer et traiter beaucoup plus de sorties de modèle que les utilisateurs humains ne le font directement.
Cependant, les informations disponibles ne comprennent ni le texte de l’article d’origine, ni le jeu de données, ni la méthodologie, ni la période étudiée, ni l’organisation nommément désignée à l’origine de la comparaison. Le chiffre de cinq fois constitue donc une affirmation rapportée, et non une statistique sectorielle vérifiable indépendamment. Cette information reste pertinente pour les concepteurs d’IA et les acheteurs d’entreprise, mais la question la plus importante n’est pas simplement de savoir si les agents utilisent davantage de tokens. Il faut déterminer comment ces tokens sont générés, quelles tâches les nécessitent et si le travail supplémentaire du modèle produit une valeur suffisante pour justifier son coût et ses risques opérationnels.
Dans une application d’IA, un token représente une unité de texte traitée par un modèle de langage. La consommation de tokens peut augmenter lorsqu’un système reçoit de longues instructions, récupère des documents, conserve l’historique d’une conversation, appelle des outils, réessaie des actions échouées ou demande à un modèle de vérifier et de réviser son propre travail. Un agent d’IA peut donc créer beaucoup plus d’interactions avec le modèle qu’une personne qui envoie une seule requête dans une interface de discussion.
Le titre publié par les deux médias présente la comparaison entre les agents d’IA et les humains. Il ne précise pas si le terme « humain » désigne des personnes utilisant des chatbots, des employés accomplissant le même processus sans IA ou une autre catégorie d’utilisateurs. Il ne précise pas non plus si l’écart de cinq fois mesure les tokens d’entrée, les tokens de sortie ou les deux.
Ces distinctions sont importantes. Un assistant de programmation peut consommer de grandes fenêtres de contexte tout en produisant des réponses relativement courtes. Un agent de recherche peut chercher, résumer, comparer et valider des informations à plusieurs reprises. Un agent de service client peut effectuer plusieurs appels invisibles au modèle avant de présenter une réponse courte à l’utilisateur. Regrouper ces schémas en un seul chiffre peut masquer des différences majeures entre les produits et les tâches.
Yahoo Finance et 24/7 Wall St. reprennent le même titre principal, avec pour seule différence un signe de ponctuation, mais les sources fournies ne contiennent pas le texte complet de l’article. Aucun extrait ne cite les chercheurs, l’entreprise, le benchmark, la taille de l’échantillon, les fournisseurs de modèles ou la période de mesure à l’origine de cette affirmation.
Par conséquent, le chiffre de cinq fois ne doit pas être considéré comme un benchmark confirmé. Les éléments disponibles ne prouvent pas non plus que l’élargissement de l’écart signalé ait été mesuré sur l’ensemble du marché des agents d’IA. Il pourrait plutôt décrire une plateforme particulière, une cohorte de clients, un processus ou une analyse interne.
Cette limite est particulièrement importante, car l’utilisation des tokens varie selon le choix du modèle et la conception de l’application. Un système qui utilise un modèle plus petit pour la classification courante aura un profil différent de celui qui oriente chaque étape vers un modèle de pointe. De même, un agent configuré pour s’arrêter après un seul appel d’outil ne peut pas être comparé directement à un autre conçu pour planifier, exécuter, examiner les résultats et réessayer jusqu’à l’achèvement d’une tâche.
Les articles permettent donc de tirer une conclusion limitée : les médias mettent en avant une hausse présumée de la consommation de tokens par les agents d’IA. Ils ne permettent pas encore d’estimer précisément l’usage à l’échelle du marché ni de démontrer que les agents deviennent économiquement inefficaces.
Pour les équipes produit, une consommation accrue de tokens se traduit par bien davantage qu’une facture de modèle plus élevée. Elle peut affecter la latence des réponses, les limites de débit, la planification de l’infrastructure, l’observabilité et la fiabilité des processus en plusieurs étapes. Un système qui étend silencieusement son contexte ou réessaie des actions peut rester précis tout en devenant trop lent ou trop coûteux pour la production.
Les équipes qui développent des agents d’IA devraient mesurer les tokens au niveau du processus, et pas seulement par requête utilisateur. Parmi les indicateurs utiles figurent les tokens par tâche terminée, les appels au modèle par résultat réussi, la fréquence des tentatives, les taux d’échec des appels d’outils et la part du travail traitée par différents modèles. Ces mesures peuvent montrer si le raisonnement supplémentaire améliore l’exécution des tâches ou crée simplement davantage d’activité.
Les acheteurs d’entreprise rencontrent une difficulté similaire. Une réponse courte dans une interface peut dissimuler une séquence beaucoup plus longue d’appels au modèle. Les équipes chargées des achats et des finances devraient demander aux fournisseurs comment l’utilisation est comptabilisée, si les appels en arrière-plan sont inclus et comment les coûts évoluent avec le nombre d’utilisateurs, de documents, d’outils et d’éléments de contexte conservés.
La tendance rapportée soulève aussi une question de conception produit. Les systèmes agentiques sont souvent présentés comme autonomes, mais l’autonomie peut nécessiter davantage de planification et de vérification. La comparaison pertinente ne porte donc pas uniquement sur le volume de tokens. Elle porte sur le coût et la qualité de l’exécution d’un processus métier défini par rapport aux logiciels existants, au travail humain ou à un flux d’IA plus simple.
Si les agents consomment davantage de tokens que les utilisateurs humains et que l’écart se creuse, l’efficacité des modèles deviendra un facteur concurrentiel central. Les développeurs pourraient privilégier de petits modèles pour le routage et l’extraction, réserver les modèles plus performants aux décisions difficiles et limiter le contexte aux informations qui influencent directement la tâche.
Parmi les autres mesures figurent la mise en cache des instructions répétées, le résumé des historiques longs, la limitation des appels d’outils inutiles et la définition de budgets explicites pour la planification et les nouvelles tentatives. Ces techniques peuvent réduire le gaspillage, mais elles peuvent aussi créer des compromis. Une compression agressive du contexte risque de supprimer des éléments utiles, tandis que des limites strictes de tokens peuvent faire s’arrêter un agent avant qu’il n’ait vérifié son travail.
Pour les entreprises de plateformes, une communication transparente sur l’utilisation pourrait devenir aussi importante que la qualité affichée du modèle. Les clients doivent savoir si un agent obtient de meilleurs résultats ou s’il génère simplement davantage d’activité d’inférence. Un benchmark fourni par un prestataire qui mesure les tokens sans mesurer la réussite des tâches donnerait une vision incomplète.
Cette affirmation compte également pour la concurrence entre fournisseurs de modèles. À mesure que les agents d’IA prendront en charge des processus plus longs, les fournisseurs capables d’obtenir des résultats fiables avec moins d’appels ou des modèles moins coûteux pourraient prendre l’avantage. Les sources disponibles n’identifient toutefois aucun fournisseur, produit ou modèle qui bénéficie actuellement d’un tel avantage.
Le premier élément à rechercher est la source de l’estimation de cinq fois. Une mise à jour crédible devrait préciser qui a recueilli les données, ce qui est considéré comme un agent, comment l’utilisation humaine a été mesurée et si les tokens d’entrée et de sortie ont été comptés séparément.
Le deuxième est le dénominateur : les tokens par utilisateur, par conversation, par tâche ou par résultat réussi produisent des conclusions très différentes. Les acheteurs devraient également rechercher des chiffres ventilés par processus, modèle et niveau d’automatisation, plutôt qu’une seule moyenne à l’échelle du marché.
Enfin, il faudra rechercher des éléments reliant une consommation accrue de tokens aux résultats commerciaux. Des mesures telles que le taux d’achèvement, la réduction des erreurs, le temps économisé et le coût total par tâche résolue permettraient de déterminer si cette hausse reflète un raisonnement productif ou une conception inefficace du système.
L’écart annoncé de cinq fois constitue un avertissement utile, mais pas encore un benchmark fiable. Au vu des éléments disponibles, l’interprétation la plus défendable est que les agents d’IA pourraient créer une nouvelle couche de demande invisible pour les modèles, que les indicateurs traditionnels d’utilisation des chatbots ne parviennent pas à mesurer.
Pour les concepteurs et les entreprises, la réponse pratique consiste à mesurer plutôt qu’à s’alarmer. Il faut suivre l’ensemble du processus de l’agent, relier la consommation de tokens aux résultats obtenus et demander aux fournisseurs de préciser comment l’inférence en arrière-plan est facturée. Tant que les données sous-jacentes ne seront pas publiées, l’affirmation d’un écart croissant doit guider les questions sur l’économie du déploiement, et non les trancher.