Tests von Claude Code und Codex ergaben große Fehler bei Zeitabschätzungen und Selbsteinschätzung und werfen Fragen zur Überwachung bei lang laufenden KI-Coding-Aufgaben auf.

Anthropic’s Claude Code und OpenAI’s Codex können Softwareaufgaben erledigen, doch eine neue Studie deutet darauf hin, dass sie nur ein schwaches Verständnis dafür haben, wie lange diese Aufgaben dauern — und eine noch schwächere Fähigkeit, ihre eigene Leistung zu beurteilen. Die Erkenntnis ist relevant, da KI-Coding-Agenten sich von kurzen interaktiven Prompts hin zu Aufgaben bewegen, die über Dutzende von Minuten oder Stunden autonom laufen.
Zwei unabhängige Forscher, die im Rahmen des MATS-Forschungsprogramms arbeiteten, testeten die Assistenten nach Angaben von The Decoder anhand von 200 Aufgaben aus ProgramBench und 18 zusätzlichen Benchmarks. Die Agenten sollten vor Beginn die erforderliche Dauer schätzen und anschließend nach Abschluss der Arbeit angeben, wie viel Zeit vergangen war. Beide Systeme überschätzten die Aufgabendauer regelmäßig und bewerteten zugleich erfolglose Arbeit deutlich besser, als es die Testergebnisse rechtfertigten.
Die Studie zeigt nicht, dass den Modellen in jeder Softwareumgebung tatsächlich der Zugriff auf Zeit fehlt. Stattdessen hebt sie eine praktische Schwäche hervor, wie aktuelle KI-Agenten vergangene Zeit wahrnehmen und diese Information zur Arbeitssteuerung nutzen. Als die Forscher ein Werkzeug bereitstellten, das die vergangene Zeit anzeigte, wurden die Agenten laut Bericht fast immer genau.
Bei ProgramBench sagten beide Agenten im Allgemeinen voraus, dass Aufgaben unabhängig vom Schwierigkeitsgrad etwa 90 Minuten dauern würden, berichtete The Decoder. In einer zweiten Testreihe lagen die Schätzungen von Claude Code im Durchschnitt um etwa das Dreifache daneben, während Codex um das Sechs- bis Zehnfache abwich.
Die größten Fehler traten bei kurzen Aufgaben auf. Laut Bericht wurden die Vorhersagen erst dann näher an der Realität, wenn sich die Arbeit über mehrere Stunden erstreckte. Dieses Muster ist operativ wichtig: Ein Agent, der für eine Aufgabe 90 Minuten prognostiziert, die er in wenigen Minuten abschließen könnte, kann schlechte Entscheidungen darüber treffen, wann er stoppen, Hilfe anfordern oder eine andere Aktion starten sollte.
Die Ergebnisse variierten auch deutlich mit der Softwareumgebung um jedes Modell herum. Claude Code arbeitete weiter, bis es die Aufgabe als erledigt ansah, mit einer gemeldeten medianen Laufzeit von etwa 90 Minuten. Codex stoppte in vielen Fällen bereits nach ungefähr einer halben Stunde, selbst wenn sich der Schwierigkeitsgrad der Aufgabe änderte.
Die Forscher führten einen Teil des Unterschieds auf das Agenten-„Harness“ zurück — also auf die Werkzeuge, Anweisungen, Ausführungsgrenzen und Kontrolllogik, die das Sprachmodell umgeben. Dasselbe zugrunde liegende Modell benötigte laut Bericht im Durchschnitt in Claude Code 2,5-mal mehr Schritte als in Codex. Das legt nahe, dass Laufzeit nicht einfach eine Eigenschaft des Modells ist; sie wird auch durch die Produktarchitektur geprägt, die es einsetzt.
Die Tests zeigten Probleme über die Zeitschätzung hinaus. Laut The Decoder überschätzten die Modelle die Qualität ihrer eigenen Arbeit im Durchschnitt um etwa 20 Prozentpunkte. Manchmal gaben sie sich selbst starke Bewertungen, obwohl die Aufgabe weitgehend gescheitert war.
In einem Beispiel bewerteten beide Systeme ihre Arbeit Berichten zufolge mit etwa 70 % Erfolg, während die gemessenen Ergebnisse 7 % und 14,5 % betrugen. Die Quelle beschreibt die beteiligten Modelle als Opus 4.8 und GPT-5.5. Da die verfügbaren Belege hier ein Bericht über die Studie und nicht die vollständige Arbeit oder die Rohdaten sind, sollten diese Modellbezeichnungen und die genauen Bewertungsbedingungen als berichtete Ergebnisse und nicht als unabhängig verifizierte Fakten behandelt werden.
Die Selbsteinschätzung ist zentral für autonome Softwarearbeit. Ein Coding-Agent muss möglicherweise entscheiden, ob er weiter iteriert, eine Aufgabe für abgeschlossen erklärt, einen Patch überarbeitet oder ein Problem an einen Menschen eskaliert. Wenn sein Vertrauen von den Testergebnissen abgekoppelt ist, kann ein Workflow gesund erscheinen, obwohl er unvollständigen oder fehlerhaften Code produziert.
Für Entwickler ist die zentrale Lehre nicht bloß, dass Claude Code und Codex schlechte Vorhersagen treffen. Entscheidend ist vielmehr, dass das Verhalten von Agenten stark von den Kontrollen um das Modell herum abhängt. Ein Produktteam, das einen KI-Coding-Assistenten auswählt, sollte nicht nur die Benchmark-Leistung bewerten, sondern auch, wie das System mit Fristen, Wiederholungsversuchen, Werkzeugfehlern, Test-Feedback und expliziten Stoppbedingungen umgeht.
Das gemeldete Ergebnis der Studie mit einem Werkzeug zur Erfassung der vergangenen Zeit bietet eine vergleichsweise einfache technische Antwort. Von einem Agenten sollte nicht erwartet werden, Zeit aus Gesprächsverlauf, Token-Erzeugung oder der Anzahl von Werkzeugaufrufen abzuleiten. Die Laufzeit sollte über eine zuverlässige externe Uhr bereitgestellt und von der Orchestrierungsschicht durchgesetzt werden.
Das löst jedoch nicht jedes Überwachungsproblem. Ein Timer kann einem Agenten zwar mitteilen, dass zwei Stunden vergangen sind, aber nicht entscheiden, ob der resultierende Code sicher, vollständig oder es wert ist, bereitgestellt zu werden. Teams benötigen möglicherweise weiterhin unabhängige Tests, Änderungsprüfungen, Sandboxing, Ausgabenlimits und Eskalationsregeln. Diese Kontrollen werden noch wichtiger, wenn ein Agent ohne kontinuierliche Aufsicht arbeiten darf.
Die Erkenntnis erschwert auch Vergleiche zwischen KI-Coding-Produkten. Die kürzere beobachtete Laufzeit von Codex und die längere Schrittfolge von Claude Code könnten eher unterschiedliche Standardwerte widerspiegeln als einen einfachen Unterschied in Intelligenz oder Produktivität. Käufer, die Produkte vergleichen, sollten fragen, was der Agent tun darf, wie lange er laufen darf und wie der Abschluss überprüft wird.
Die Evidenz stammt aus einer Studie von zwei unabhängigen Forschern im Rahmen von MATS, wie The Decoder berichtet. Der gemeldete Testumfang kombinierte ProgramBench mit einer zusätzlichen Benchmark-Suite mit 18 Aufgaben. Der Bericht liefert numerische Ergebnisse für Zeitschätzung, Laufzeit, Schrittzahlen und Selbsteinschätzung, aber das hier verfügbare Material enthält nicht die vollständige Methodik, Aufgabendefinitionen, statistische Analyse oder unabhängige Replikation.
Daher sollten die Ergebnisse als Hinweis auf eine spezifische Schwäche in der Evaluierung gelesen werden, nicht als universelles Maß für jede Version jedes KI-Agenten. Ergebnisse können sich mit Modellaktualisierungen, System-Prompts, verfügbaren Werkzeugen, Kontextfenstern, Aufgabentypen und Harness-Design ändern. Die Behauptung, dass der Zugriff auf ein Werkzeug zur Messung der vergangenen Zeit nahezu universelle Genauigkeit erzeugte, ist besonders als technisches Signal nützlich, stammt aber dennoch aus der berichteten Studie und benötigt breitere Tests.
Es gibt außerdem einen wichtigen Unterschied zwischen Zeitschätzen und Zeitverfolgung. Ein Agent kann in der Lage sein, eine Uhr abzulesen, wenn ihm das passende Werkzeug zur Verfügung steht, und dennoch scheitern, vorherzusagen, wie lange eine unbekannte Aufgabe dauern wird. Produktteams sollten beide Fähigkeiten getrennt testen.
Die Forscher planen Berichten zufolge zu testen, ob Agenten Anweisungen wie etwa, eine bestimmte Dauer ohne Unterbrechung zu arbeiten, befolgen können. Dieses Experiment könnte zeigen, ob externe Zeitinformationen nicht nur die rückblickende Berichterstattung verbessern, sondern auch die Echtzeitsteuerung von Aufgaben.
Folgeevaluierungen sollten auch neuere Modellversionen, längere Softwareprojekte, Fehlerbehebung und unterschiedliche Harnesses testen. Ein nützliches Benchmark würde messen, ob ein Agent eine Frist einhält, vor Ablauf der Frist ein nutzbares Ergebnis liefert und genau berichtet, was noch nicht erledigt ist.
Für Unternehmenskunden werden die praktischen Signale im Produktdesign sichtbar sein: dauerhaft angezeigte vergangene Zeit, harte Ausführungsbudgets, unabhängige Verifikation und klare Übergabemechanismen. Anbieter, die reproduzierbare Daten zu diesen Kontrollen veröffentlichen, werden es erleichtern, echte Autonomie von Agenten zu unterscheiden, die lediglich so lange weiterarbeiten, bis ein verborgener Grenzwert erreicht ist.
Die Studie weist auf ein Kontrollproblem an der Grenze zwischen Sprachmodellen und autonomer Software hin. Zeitbewusstsein ist keine abstrakte menschliche Eigenschaft, die Produkte irgendwie nachahmen müssen; es ist eine messbare Systemfähigkeit, die durch die Orchestrierungsschicht bereitgestellt und mit externen Ereignissen abgeglichen werden kann.
Für KI-Entwickler ist die Schlussfolgerung, Dauerabschätzungen und selbst gemeldeten Erfolg als unzuverlässige Signale zu behandeln. Lang laufende Agenten sollten eine externe Uhr, explizite Budgets, unabhängige Tests und Eskalationspfade haben. Solange diese Mechanismen nicht Standard sind, bleibt „autonomes“ Coden eine Workflow-Behauptung, die Aufgabe für Aufgabe validiert werden muss.