AWS demande aux acheteurs d’évaluer les modèles OpenAI sur Bedrock selon les résultats, et non selon le prix des jetons

Les données de benchmark d’AWS suggèrent que les modèles OpenAI sur Amazon Bedrock peuvent réduire le coût des réponses correctes lorsque les équipes mesurent la qualité, le nombre de tours et les reprises.

AI News

Amazon Web Services demande aux équipes de repenser la façon dont elles choisissent les modèles OpenAI sur Amazon Bedrock, en soutenant que le prix le plus bas par million de jetons ne produit pas nécessairement le coût de production le plus faible. Dans un nouvel article du AWS Machine Learning Blog, l’entreprise a publié un outil d’évaluation open source qui compare la précision des modèles, le nombre de tours d’agent et le coût d’un travail acceptable.

L’analyse couvre trois modèles OpenAI disponibles via Amazon Bedrock — gpt-5.6-luna, gpt-5.6-terra et gpt-5.6-sol — et les compare à gpt-5.4-mini et gpt-5.4-nano via l’API OpenAI. AWS indique que l’objectif est de calculer le coût d’une réponse correcte, d’un résultat de recherche validé ou d’un livrable professionnel acceptable, plutôt que de traiter le prix des jetons comme la principale métrique d’achat.

Les résultats sont rapportés par le fournisseur et proviennent de l’outil de test d’AWS. Il ne s’agit pas non plus d’une comparaison entièrement contrôlée : AWS précise que les modèles Bedrock ont été exécutés avec le raisonnement désactivé, tandis que les références de l’API utilisaient leurs paramètres par défaut. L’entreprise conseille aux clients de reproduire les tests sur leurs propres charges de travail avant de prendre une décision de modèle.

AWS reconsidère le calcul du choix de modèle

L’argument d’AWS est simple : les applications de production paient pour des résultats, pas pour des jetons. Un modèle moins cher par requête peut devenir plus coûteux s’il répond incorrectement, exige des reprises ou oblige un humain à corriger sa sortie.

Pour tester cette idée, AWS a exécuté le même chemin de code de l’API Responses d’OpenAI sur cinq modèles, en gardant sa logique d’évaluation constante. Le benchmark comprenait les mathématiques AIME, la science de niveau doctoral GPQA Diamond et MMLU-Pro. AWS a divisé les dépenses totales du modèle — y compris les tentatives échouées — par le nombre de réponses correctes afin d’estimer le coût observé par réponse correcte.

Dans l’échantillon de l’entreprise, gpt-5.6-sol a atteint 75 % de précision sur AIME, contre 37 % pour gpt-5.4-mini. Il a également dominé les résultats rapportés pour GPQA Diamond et MMLU-Pro. AWS avertit qu’il s’agit de résultats d’échantillon et non d’un classement universel, et que les petites différences doivent être considérées comme indicatives sauf si elles sont étayées par des estimations d’incertitude.

La conclusion tarifaire a changé après qu’AWS a cité une réduction du 30 juillet 2026 pour GPT-5.6 Luna et Terra sur Amazon Bedrock. AWS a indiqué un coût de 0,0021 dollar par réponse correcte AIME pour gpt-5.6-luna, contre 0,0139 dollar pour gpt-5.4-mini selon les hypothèses de ses fichiers de résultats. L’article indique que le coût observé par réponse correcte de Luna était inférieur à celui des alternatives testées, y compris gpt-5.4-nano.

Ces chiffres ne doivent pas être interprétés comme des prix universels actuels. AWS invite explicitement les lecteurs à vérifier la région Amazon Bedrock applicable et le niveau d’inférence correspondant sur la page de tarification en direct. L’article note également que les mises à jour de la page de prix peuvent ne pas coïncider immédiatement avec une annonce.

Les trajectoires d’agents peuvent l’emporter sur les prix affichés

La partie la plus importante de l’analyse concerne les agents IA, où chaque appel de modèle peut s’accompagner d’un historique de conversation croissant. AWS a testé un échantillon de 50 questions de DeepSearchQA à l’aide des outils live web_search et fetch_page. L’agent gérait son propre historique avec le stockage désactivé, ce qui signifie que l’invite système, les résultats d’outils précédents et le contexte de conversation étaient renvoyés à chaque tour.

Cette conception fait du nombre de tours un facteur direct de coût et de latence. AWS affirme que l’entrée cumulée peut croître approximativement de manière quadratique à mesure qu’un agent ajoute du contexte. Dans son échantillon, gpt-5.4-mini a enregistré en moyenne 7,6 tours par question, principalement en raison de boucles de recherche répétées. Son volume d’entrée a atteint 114 000 jetons par question, contre 50 000 pour gpt-5.6-terra.

AWS a indiqué que Terra coûtait 0,31 dollar par réponse validée dans le test, contre 0,40 dollar pour mini, tout en affichant un score F1 moyen plus élevé. Il a rapporté un coût encore plus faible de 0,05 dollar par réponse validée pour gpt-5.6-luna, contre 0,40 dollar pour mini. Nano avait un prix nominal par jeton plus bas, mais n’a validé que 18 % des questions, ce qui a donné un coût observé de 0,07 dollar par réponse validée.

L’échantillon ne contenait que 50 questions, les comparaisons ne sont donc pas निर्णantes. Malgré tout, le résultat met en évidence une variable de coût qui n’apparaît pas sur une page de tarification standard : l’efficacité avec laquelle un modèle accomplit un flux de travail utilisant des outils.

La qualité modifie l’économie du travail professionnel

AWS a également testé GDPval, un benchmark construit autour de livrables professionnels plutôt que de questions à réponse courte. Son échantillon de 48 tâches couvrait des documents tels que des notes de conformité, des plans financiers et des protocoles de soins, chaque sortie étant évaluée selon une grille rédigée par des professionnels.

L’entreprise a indiqué que les trois configurations gpt-5.6 obtenaient des scores supérieurs aux configurations mini et nano testées lorsque le raisonnement était désactivé. Luna a validé 27 des 48 tâches, contre 20 pour mini. Après la baisse de prix signalée, AWS a calculé le coût de Luna par livrable validé à 0,010 dollar, contre 0,030 dollar pour mini et 0,012 dollar pour nano.

Le résultat n’est pas une mesure propre de la qualité générale du modèle. AWS dit que les catégories professionnelles avaient de petits échantillons, et la limite de sortie de 8 192 jetons a tronqué six livrables Luna, neuf Terra, sept Sol, zéro mini et un nano. Une limite de sortie plus élevée pourrait modifier à la fois la qualité et le coût.

Pour les acheteurs en entreprise, toutefois, le test soulève une question pratique : quelle valeur accorder à un meilleur taux de réussite lorsque l’alternative nécessite une revue, des retouches ou une escalade ? Un modèle plus cher peut être rentable s’il réduit ces coûts en aval, tandis qu’un modèle moins cher peut rester préférable pour des tâches de classification ou de rédaction à faible risque.

Ce que les résultats signifient pour les développeurs et les entreprises

L’outil d’évaluation d’AWS, identifié dans l’article comme openai-on-aws/benchmarks-openai, permet aux équipes d’ingénierie d’évaluer le choix du modèle à l’aide de leurs propres prompts et critères d’acceptation. C’est important, car le meilleur modèle pour un agent de recherche n’est pas forcément le meilleur pour une chaîne d’extraction à fort volume, et un score de benchmark peut ne pas refléter la tolérance d’une entreprise aux erreurs.

Les équipes qui construisent des agents IA devraient suivre les tours, les appels d’outils, la croissance des entrées, la latence et le coût des tâches réussies en parallèle des dépenses en jetons. Elles devraient également décider si leur application peut réutiliser le contexte stocké, limiter les boucles de recherche, résumer les résultats des outils ou orienter les cas difficiles vers un modèle plus puissant. Ces contrôles peuvent modifier l’économie indépendamment du prix du modèle sous-jacent.

Pour les équipes produit, l’unité la plus utile peut être le coût par document approuvé, ticket résolu ou flux de travail achevé. Cela nécessite une grille stable et un enregistrement des sorties échouées, des modifications humaines, des reprises et des taux d’escalade. L’utilisation par AWS de vérifications déterministes et d’un juge LLM illustre une approche, mais les propres réserves de l’entreprise montrent pourquoi la conception de l’évaluation reste une partie du problème de déploiement.

Ce qu’il faut surveiller ensuite

Le signal immédiat est de savoir si les changements de tarification du 30 juillet d’AWS se reflètent de manière cohérente dans les régions Amazon Bedrock et les niveaux d’inférence. Les acheteurs devraient également surveiller si l’outil open source obtient des reproductions indépendantes avec le raisonnement activé, des configurations de modèle alignées, des échantillons plus larges et des stratégies de gestion du contexte proches de la production.

D’autres évaluations devraient tester la fiabilité sur des exécutions répétées, la sécurité de l’utilisation des outils, la résistance aux injections de prompt, la latence, la troncature des sorties et le coût de la revue humaine. Ces mesures pourraient réduire — ou accroître — l’avantage qu’AWS rapporte pour gpt-5.6-luna et les autres modèles gpt-5.6.

Point de vue de Creati.ai

AWS corrige utilement une habitude d’achat courante : le prix du jeton est visible, tandis que les coûts d’échec et de reprise sont répartis dans toute l’application. Les résultats rapportés plaident pour une mesure du choix du modèle au niveau du workflow, en particulier pour les agents qui appellent à plusieurs reprises des outils et renvoient le contexte accumulé.

Mais les preuves restent contrôlées par AWS et spécifiques à la configuration. La principale leçon n’est pas qu’un modèle OpenAI est universellement le moins cher. C’est que les développeurs devraient tester le coût d’un résultat réussi et acceptable sur leur propre charge de travail avant de laisser un tableau de prix décider de l’architecture.

Publicités