Googles Gemini 4 Argon verkleinert den Abstand zur Frontier, führt aber nicht eindeutig

Googles Gemini 4 Argon liegt bei einem Index gleichauf mit OpenAIs GPT-6 Astra, bleibt hinter den Spitzenmodellen von Anthropic zurück und startet zunächst für ausgewählte Tester.

AI News

Google hat Gemini 4 Argon vorgestellt, ein neues Spitzenmodell, mit dem das Unternehmen nach mehr als sieben Monaten ohne neue Frontier-Veröffentlichung wieder in direkten Wettbewerb mit OpenAI und Anthropic tritt. Frühe Tests deuten darauf hin, dass Argon deutlich stärker ist als Googles vorheriges Modell und mit OpenAIs GPT-6 Astra konkurrieren kann. Die führenden Systeme von Anthropic scheinen insgesamt jedoch weiterhin im Vorteil zu sein.

Die Veröffentlichung ist weniger wegen eines einzelnen Benchmark-Siegs bemerkenswert als wegen der darin sichtbaren Kompromisse. Argon bietet ein Ausgabelimit von einer Million Tokens und ungewöhnlich niedrige Einführungspreise, während unabhängige Tests zeigen, dass es für dieselben Aufgaben wesentlich mehr Tokens als einige Konkurrenten verbraucht. Google beschränkt den Zugang außerdem, während das Unternehmen Sicherheitsfeedback sammelt. Entwickler können das Modell daher noch nicht über eine allgemein verfügbare API bewerten.

Eine stufenweise Einführung mit ungewöhnlich langen Ausgaben

Laut The Decoder stellt Google Argon zunächst ausgewählten „vertrauenswürdigen Cyber-Verteidigern“ über sein Fairwind-Programm sowie internen Teams bereit. Die erste Version arbeitet in dieser Testumgebung Berichten zufolge ohne Cyber-Schutzvorkehrungen. Google nimmt außerdem an einem freiwilligen US-Regierungsprogramm teil, das Behörden frühzeitigen Zugang zu neuen Modellen gewährt.

Das Unternehmen will das Feedback der Tester nutzen, um Argons Sicherheitsmechanismen zu verbessern, bevor der Zugang auf Entwickler, Unternehmen und Verbraucher ausgeweitet wird. Zahlende API-Kunden und Abonnenten von Google AI Ultra sollen als Nächste Zugang erhalten, allerdings hat Google keinen verbindlichen öffentlichen Termin genannt.

Die wichtigste Fähigkeit des Modells ist sein Ausgabelimit von einer Million Tokens, gegenüber 64.000 Tokens bei der vorherigen Generation. Argon behält ein Kontextfenster von einer Million Tokens bei und akzeptiert Text, Bilder, Video und Audio, erzeugt jedoch ausschließlich Text. Google ergänzt eine Gemini-API-Funktion namens Long Decode Continuation, die eine lange Antwort pausieren und über Folgeanfragen fortsetzen kann, statt einen langwierigen Reasoning-Prozess wegen eines Timeouts abbrechen zu lassen.

Dieses Design zielt auf komplexe Recherche-, Coding- und agentische Workflows, in denen ein Modell eine lange Argumentationskette aufrechterhalten muss. Es wirft für Käufer aber auch eine praktische Frage auf: Führt ein höheres Ausgabelimit zu besseren Ergebnissen bei vertretbaren Kosten oder erzeugt es lediglich mehr Text?

Unabhängige Tests zeigen Fortschritte, aber keine Dominanz

Die stärksten verfügbaren Leistungsdaten stammen von Artificial Analysis, wie The Decoder berichtet. Bei seiner höchsten gemeldeten Reasoning-Einstellung erzielte Argon 53 Punkte im Artificial Analysis Intelligence Index. Damit lag es gleichauf mit OpenAIs GPT-6 Astra und Anthropics Claude Fable 5.1 und einen Punkt vor GPT-6.1 Sol. Anthropics Claude Opus 5.5 erreichte 58 Punkte, Claude Sonnet 5.5 kam auf 56.

Das Ergebnis stellt eine deutliche Verbesserung gegenüber Googles Gemini 3.1 Pro Preview dar, das Argon Berichten zufolge um 23 Punkte übertraf. Ein Gleichstand mit einem OpenAI-Modell bedeutet jedoch nicht, dass Argon die Frontier insgesamt klar anführt. Die Einschätzung von The Decoder sieht Anthropic beim Index vorn, während die Benchmark-Ergebnisse je nach Aufgabe erheblich variieren.

Bei einigen agentischen Tests schnitt Argon besonders gut ab. Artificial Analysis meldete bei AutomationBench-AA 77,5 Prozent, sechs Punkte mehr als Claude Sonnet 5.5. Bei Terminal Bench 4 erreichte Argon 57 Prozent: eine deutliche Verbesserung gegenüber Gemini 3.1 Pro Preview, aber weniger als Claude Sonnet 5.5 mit 64 Prozent, Claude Opus 5.5 mit 60 Prozent und GPT-6 Astra mit 59 Prozent.

Beim AA-Omniscience-Test verzeichnete das Modell mit 15 Prozent außerdem eine niedrigere Halluzinationsrate als die verglichenen Systeme: GPT-6 Astra kam auf 51 Prozent und GPT-6.1 Sol auf 54 Prozent. Seine Genauigkeit lag in diesem Test jedoch bei 50 Prozent und damit unter Gemini 3.1 Pro Preview und GPT-6 Astra. Dieser Unterschied ist für Unternehmensanwendungen wichtig: Nicht zu raten kann die Zuverlässigkeit erhöhen, bedeutet aber nicht automatisch, dass das System mehr weiß.

Googles eigene Benchmark-Ergebnisse zeigen Argon Berichten zufolge in vielen Kategorien an der Spitze, während Vals AI es mit 68,9 Prozent auf Platz eins setzte. Diese Aussagen sind an den Anbieter gebunden oder beruhen auf ausgewählten externen Bewertungen und sollten nicht als universelles Ranking verstanden werden. The Decoder wies außerdem darauf hin, dass die Vals-Ergebnisse Anthropics mittelklassiges Sonnet 5.5 vor dem Spitzenmodell Opus 5.5 platzierten – ein Grund, das Ranking vorsichtig zu interpretieren.

Niedrige Tokenpreise treffen auf hohen Tokenverbrauch

Google führt Argon mit 2 US-Dollar pro Million Eingabetokens und 10 US-Dollar pro Million Ausgabetokens ein. Die regulären Preise sollen auf 4 beziehungsweise 20 US-Dollar steigen. Für zwischengespeicherte Eingaben gibt es 95 Prozent Rabatt, was dem von The Decoder gemeldeten Zahlen zufolge einem Einführungspreis von etwa 10 Cent pro Million Tokens entspricht.

Diese Preise wirken für ein Frontier-Modell niedrig, doch der Tokenpreis allein bestimmt nicht die Anwendungskosten. Artificial Analysis zufolge verwendete Argon pro Aufgabe im Intelligence Index durchschnittlich 62.000 Ausgabetokens, GPT-6 Astra dagegen 27.000. Dadurch wurden die geschätzten Kosten einer Argon-Aufgabe zum Aktionspreis mit 1,99 US-Dollar angegeben, gegenüber 3,26 US-Dollar für Astra. Nach Inkrafttreten des regulären Argon-Preises steigt dieselbe Berechnung auf etwa 3,98 US-Dollar.

Für Entwickler ist die Schlussfolgerung klar: Argon kann für Workloads wirtschaftlich sein, die von langem Reasoning profitieren und zusätzliche Ausgaben tolerieren, weniger jedoch, wenn Latenz, Tokenvolumen oder planbare Kosten wichtig sind. Teams müssen die Kosten des vollständigen Workflows messen, statt veröffentlichte Preise pro Token zu vergleichen.

Auch die Leistung außerhalb des reinen Reasonings ist uneinheitlich. Arena.ai setzte Gemini 4 Argon Berichten zufolge in seiner Text Arena auf Platz eins, einschließlich Coding, Befolgen von Anweisungen, schwieriger Prompts und kreativem Schreiben. Im WebDev-Test der Code Arena belegte es dagegen Platz acht. Dieser Abstand unterstreicht, wie wichtig es ist, ein Modell innerhalb des Software-Stacks, der Tools, der Retrieval-Systeme und der Benutzeroberfläche zu bewerten, in denen es tatsächlich eingesetzt wird.

Was als Nächstes zu beobachten ist

Das unmittelbare Signal wird Googles öffentliche API-Veröffentlichung sein und die Frage, ob das Unternehmen den Einführungspreis lange genug beibehält, damit Entwickler Produktions-Workloads testen können. Der Zugang für zahlende API-Kunden und Google-AI-Ultra-Abonnenten ist geplant, ein Termin wurde jedoch nicht bekannt gegeben.

Unternehmenskunden sollten unabhängige Messungen von Latenz, Ausgabetoken-Verbrauch, Verweigerungsverhalten und Zuverlässigkeit bei der Tool-Nutzung beobachten. Das Ausgabelimit von einer Million Tokens wird nur dann relevant sein, wenn lange Antworten die Aufgabenerledigung verbessern, ohne ausufernde Kosten oder schwer prüfbares agentisches Verhalten zu erzeugen.

Das umfassendere Wettbewerbssignal wird aus der Produktintegration kommen. The Decoder berichtete, dass Googles Gemini-App trotz der starken Benchmark-Ergebnisse weiterhin hinter Produkten wie Claude Cowork und ChatGPT Work zurückliegt. Wenn Google das Modell nicht mit besseren Agentenoberflächen, Tools und Workflow-Kontrollen verbinden kann, könnten Benchmark-Gewinne nur begrenzte Auswirkungen auf die Verbreitung haben.

Die Perspektive von Creati.ai

Gemini 4 Argon wirkt wie eine glaubwürdige Rückkehr an die Frontier und nicht wie eine entschiedene Übernahme der Spitzenposition. Die Fortschritte sind bedeutend: Berichten zufolge schließt das Modell einen großen Teil des Abstands zu OpenAI, verbessert Googles schwache Ergebnisse bei mehreren agentischen Tests und bietet einen überzeugenden Einführungspreis. Die höheren Intelligence-Index-Werte von Anthropic und Argons hoher Tokenverbrauch erschweren jedoch die Kosten-Leistungs-Bilanz.

Für KI-Entwickler ist die Veröffentlichung am besten als eine weitere starke Option zu verstehen, die aufgabenspezifische Tests erfordert. Die Gewinner dieser Runde werden nicht durch eine einzelne Rangliste bestimmt. Entscheidend wird sein, welches Modell zuverlässige Ergebnisse, beherrschbare Inferenzkosten, nützliche Tool-Ausführung und einen sicheren Einsatz bietet, sobald nicht nur ausgewählte Tester, sondern echte Nutzer darauf zugreifen können.

Anzeigen