Le Gemini 4 Argon de Google égale le GPT-6 Astra d’OpenAI sur un indice, reste derrière les meilleurs modèles d’Anthropic et est d’abord lancé auprès de testeurs sélectionnés.

Google a dévoilé Gemini 4 Argon, un nouveau modèle phare qui ramène l’entreprise en concurrence directe avec OpenAI et Anthropic après plus de sept mois sans nouvelle sortie de modèle de frontière. Les premiers tests suggèrent qu’Argon est nettement plus puissant que le précédent modèle de Google et compétitif face au GPT-6 Astra d’OpenAI, mais les systèmes de pointe d’Anthropic semblent toujours conserver l’avantage général.
La sortie est moins remarquable par une victoire dans un benchmark que par les compromis qu’elle met en évidence. Argon offre une limite de sortie d’un million de tokens et des tarifs de lancement exceptionnellement bas, tandis que des tests indépendants indiquent qu’il consomme beaucoup plus de tokens que certains rivaux pour accomplir les mêmes tâches. Google limite également l’accès pendant qu’il recueille des retours sur la sécurité : les développeurs ne peuvent donc pas encore évaluer le modèle au moyen d’une API largement disponible.
Selon The Decoder, Google fournit d’abord Argon à des « défenseurs cyber de confiance » sélectionnés dans le cadre de son programme Fairwind, ainsi qu’à ses équipes internes. La première version fonctionnerait sans garde-fous cyber dans cet environnement de test. Google participe aussi à un programme volontaire du gouvernement américain donnant aux agences un accès anticipé aux nouveaux modèles.
L’entreprise compte utiliser les retours des testeurs pour améliorer les mécanismes de sécurité d’Argon avant d’élargir l’accès aux développeurs, aux entreprises et aux particuliers. Les clients API payants et les abonnés à Google AI Ultra devraient ensuite y accéder, mais Google n’a pas annoncé de date publique ferme.
La capacité phare du modèle est sa limite de sortie d’un million de tokens, contre 64 000 pour la génération précédente. Argon conserve une fenêtre de contexte d’un million de tokens et accepte le texte, les images, la vidéo et l’audio, mais ne produit que du texte. Google ajoute à l’API Gemini une fonctionnalité appelée Long Decode Continuation, qui peut mettre en pause une longue réponse et la reprendre via des requêtes ultérieures au lieu de laisser un long processus de raisonnement expirer.
Cette conception vise les flux de travail complexes de recherche, de programmation et d’agents, où un modèle peut devoir maintenir une longue chaîne de raisonnement. Elle pose aussi une question pratique aux acheteurs : un plafond de sortie plus élevé produit-il de meilleurs résultats à un coût acceptable, ou génère-t-il simplement davantage de texte ?
Les données de performance les plus solides disponibles proviennent d’Artificial Analysis, comme le rapporte The Decoder. Avec son niveau de raisonnement le plus élevé, Argon a obtenu 53 points à l’Artificial Analysis Intelligence Index. Il a égalé le GPT-6 Astra d’OpenAI et le Claude Fable 5.1 d’Anthropic, et devancé GPT-6.1 Sol d’un point. Le Claude Opus 5.5 d’Anthropic a obtenu 58 points, contre 56 pour Claude Sonnet 5.5.
Ce résultat représente une nette amélioration par rapport au Gemini 3.1 Pro Preview de Google, qu’Argon aurait dépassé de 23 points. Toutefois, égaler un modèle d’OpenAI ne revient pas à prendre clairement la tête de toute la frontière. L’évaluation de The Decoder place Anthropic devant sur l’indice, tandis que les résultats varient fortement selon les tâches.
Argon s’est particulièrement bien comporté dans certaines évaluations agentiques. Artificial Analysis lui a attribué 77,5 % à AutomationBench-AA, soit six points de plus que Claude Sonnet 5.5. Sur Terminal Bench 4, Argon a atteint 57 %, une progression importante par rapport au Gemini 3.1 Pro Preview, mais moins que Claude Sonnet 5.5 à 64 %, Claude Opus 5.5 à 60 % et GPT-6 Astra à 59 %.
Le modèle a également affiché un taux d’hallucination inférieur à celui des systèmes comparés sur AA-Omniscience : 15 %, contre 51 % pour GPT-6 Astra et 54 % pour GPT-6.1 Sol. Sa précision sur ce test était toutefois de 50 %, inférieure à celle du Gemini 3.1 Pro Preview et du GPT-6 Astra. Cette distinction compte pour les applications d’entreprise : refuser de deviner peut améliorer la fiabilité, mais ne signifie pas automatiquement que le système en sait davantage.
Les propres résultats de Google montreraient qu’Argon est en tête dans de nombreuses catégories, tandis que Vals AI l’a classé premier avec 68,9 %. Ces affirmations sont liées au fournisseur ou fondées sur certaines évaluations externes et ne doivent pas être considérées comme un classement universel. The Decoder a également relevé que les résultats de Vals plaçaient le Sonnet 5.5 intermédiaire d’Anthropic devant son modèle phare Opus 5.5, raison d’interpréter le classement avec prudence.
Google lance Argon à 2 dollars par million de tokens d’entrée et 10 dollars par million de tokens de sortie. Les tarifs habituels devraient passer à 4 et 20 dollars respectivement. Les entrées mises en cache bénéficient d’une remise de 95 %, ce qui porterait le tarif initial à environ 10 centimes par million de tokens, d’après les chiffres rapportés par The Decoder.
Ces tarifs semblent bas pour un modèle de frontière, mais le prix des tokens ne détermine pas à lui seul le coût d’une application. Artificial Analysis a indiqué qu’Argon utilisait en moyenne 62 000 tokens de sortie par tâche de l’Intelligence Index, contre 27 000 pour GPT-6 Astra. Le coût estimé d’une tâche Argon était donc de 1,99 dollar au tarif promotionnel, contre 3,26 dollars pour Astra. Une fois le tarif normal d’Argon appliqué, le même calcul atteint environ 3,98 dollars.
Pour les développeurs, l’implication est claire : Argon peut être économique pour les charges qui tirent parti d’un raisonnement long et tolèrent une sortie supplémentaire, mais moins lorsque la latence, le volume de tokens ou la prévisibilité des dépenses sont importants. Les équipes devront mesurer le coût du flux complet plutôt que comparer les seuls tarifs publiés par token.
Les performances du modèle au-delà du raisonnement brut sont également inégales. Arena.ai aurait classé Gemini 4 Argon premier dans sa Text Arena, qui comprend le codage, le suivi des instructions, les prompts difficiles et l’écriture créative. Dans le test WebDev de Code Arena, il s’est toutefois classé huitième. Cet écart souligne l’importance d’évaluer un modèle au sein de la pile logicielle, des outils, des systèmes de récupération et de l’interface utilisateur où il fonctionnera réellement.
Le signal immédiat sera la sortie de l’API publique de Google et la question de savoir si l’entreprise maintiendra le tarif de lancement assez longtemps pour que les développeurs testent des charges de production. L’accès est prévu pour les clients API payants et les abonnés à Google AI Ultra, mais aucune date n’a été annoncée.
Les acheteurs d’entreprise devraient suivre les mesures indépendantes de latence, de consommation de tokens de sortie, de comportement de refus et de fiabilité de l’utilisation des outils. La limite de sortie d’un million de tokens ne comptera que si les réponses longues améliorent l’accomplissement des tâches sans entraîner de coûts incontrôlables ni de comportements d’agents difficiles à auditer.
Le signal concurrentiel plus large viendra de l’intégration produit. The Decoder a rapporté que l’application Gemini de Google reste derrière des produits comme Claude Cowork et ChatGPT Work, malgré les solides résultats d’Argon dans les benchmarks. Si Google ne parvient pas à associer le modèle à de meilleures interfaces d’agents, à des outils et à des contrôles de flux de travail, les gains dans les benchmarks pourraient avoir un impact limité sur l’adoption.
Gemini 4 Argon ressemble à un retour crédible à la frontière plutôt qu’à une prise de contrôle décisive. Ses progrès sont significatifs : il réduirait une grande partie de l’écart avec OpenAI, améliorerait les faibles résultats de Google dans plusieurs tests agentiques et proposerait un prix de lancement attrayant. Mais les scores plus élevés d’Anthropic à l’Intelligence Index et la forte consommation de tokens d’Argon compliquent le bilan coût-performance.
Pour les développeurs d’IA, cette sortie doit surtout être considérée comme une nouvelle option solide qui exige des tests propres à chaque charge de travail. Les vainqueurs de ce round ne seront pas déterminés par un seul classement. Ils le seront par le modèle capable de fournir des résultats fiables, des coûts d’inférence maîtrisables, une exécution utile des outils et un déploiement sûr lorsque de vrais utilisateurs, et non seulement des testeurs sélectionnés, pourront y accéder.