KI-Agenten übernehmen mehr Entwicklungsarbeit, aber Menschen treffen weiterhin die kritischen Entscheidungen

Eine mit Fudan verbundene Studie zeigt, dass KI-Agenten einen großen Teil der Modellentwicklungsarbeit vorschlagen, während Menschen die endgültige Kontrolle behalten – und damit die Grenzen der Autonomie in der Praxis offenbaren.

AI News

KI-Agenten übernehmen einen wachsenden Anteil der Arbeit beim Aufbau von KI-Modellen, doch eine neue Analyse legt nahe, dass sie deutlich weniger Einfluss haben, wenn Forschende entscheiden, was verfolgt und wie vorgegangen werden soll.

Ein Forschungsteam unter Beteiligung der chinesischen Fudan University prüfte 769 Aufgabenprotokolle aus einem Modellentwicklungsprojekt mit 56 Teilnehmenden und den von ihnen genutzten Agenten. Die Studie ergab, dass KI bis zu 55,4 % der Vorschläge für Methoden und Parameter lieferte, während Menschen in diesen Bereichen 85,5 % der endgültigen Entscheidungen trafen. Auch bei der Auswahl von Projektzielen und -umfang entschieden Menschen in 93,4 % der Fälle.

Die Ergebnisse zeichnen ein nuancierteres Bild der Agentenautonomie, als reine Aktivitätsmessungen vermuten lassen könnten. Agenten erledigten Arbeit, erzeugten Optionen und übernahmen Überarbeitungen, doch das menschliche Urteilsvermögen blieb der zentrale Kontrollpunkt – insbesondere dann, wenn das Projekt auf Unklarheiten, Fehler oder strategische Entscheidungen stieß.

Atria Dawn Preview als Testfall

Im Mittelpunkt des Projekts stand Atria Dawn Preview, ein agentisches Sprachmodell auf Basis einer Mixture-of-Experts-Architektur mit 744 Milliarden Parametern. Das Team entwickelte es für Forschungs- und Ingenieuraufgaben und nutzte einen Workflow, in dem jede Aufgabe mit einer Ausführungsumgebung verknüpft war. Agenten konnten Werkzeuge aufrufen, Zwischenergebnisse erzeugen und Feedback aus Tests, Metriken oder Quellnachweisen erhalten.

Die Forschenden berichteten, dass KI in 96,5 % der geprüften Aufgaben eingesetzt wurde. Über vier Wochen stieg das Medianverhältnis von Agentenaktionen zu menschlichen Eingaben von 11 auf 28,5. Dieser Anstieg könnte so wirken, als würden Agenten unabhängiger, doch die Autoren argumentieren, dass er vor allem ein anderes Muster widerspiegelt: Eine menschliche Entscheidung löste oft eine längere Kette von Agentenaktionen aus.

Dem Bericht zufolge lag das Modell bei fünf von 16 Benchmarks vorn, darunter Websuche und Cybersicherheit. Die Quelle deutet jedoch nicht darauf hin, dass Atria Dawn Preview insgesamt gegenüber konkurrierenden Systemen die Führung übernommen hat. Daher sollten die Benchmark-Ergebnisse eher als begrenzter Leistungsanspruch denn als Beweis allgemeiner Überlegenheit verstanden werden.

Agenten schlugen Optionen vor; Menschen wählten die Richtung

Das häufigste Entscheidungsmuster war „KI schlägt vor, Mensch wählt aus“ und machte 55,4 % der Entscheidungen zu Methoden und Parametern aus. In derselben Kategorie traf KI 9,2 % der endgültigen Entscheidungen, verglichen mit 85,5 % bei Menschen. Der Anteil der KI-Vorschläge variierte je nach Entscheidungstyp zwischen 17 % und 55 %, doch ihre Rolle bei der endgültigen Auswahl blieb im einstelligen Bereich.

Die menschliche Kontrolle war bei Entscheidungen auf Projektebene noch stärker. Forschende trafen in 93,4 % der Fälle die endgültige Entscheidung über Ziele und Umfang. Unter 151 Aufgaben, von denen Teilnehmende sagten, sie wären ohne KI nicht machbar gewesen, wählten Menschen das Ziel dennoch in 95,4 % der Fälle aus.

Dieser Unterschied ist für die Modellentwicklung wichtig. Ein Agent kann einen großen Raum möglicher Implementierungen durchsuchen oder ein komplexes Experiment durchführen, ohne selbst zu entscheiden, ob sich das Experiment lohnt. Die Evidenz der Studie legt nahe, dass aktuelle Systeme eher als Forschungshelfer und Vorschlagsgeneratoren wirksam sind als als Träger einer Forschungsagenda.

KI ermöglichte mehr Arbeit, nicht nur schneller

Die Studie weist auch auf einen weniger offensichtlichen Effekt von KI-Agenten hin. Von 455 abgeschlossenen KI-gestützten Aufgaben stuften Teilnehmende 151 – also ungefähr ein Drittel – als ohne KI im selben Umfang und derselben Qualität nicht machbar ein. Diese Aufgaben verteilten sich auf 27 der 56 Teilnehmenden und konzentrierten sich nicht nur auf wenige fortgeschrittene Nutzer.

Dieses Ergebnis legt nahe, dass Agenten den Umfang der Arbeit erweitern können, die Teams überhaupt in Angriff nehmen, statt lediglich bestehende Abläufe zu beschleunigen. Für KI-Entwickler könnte das bedeuten, dass mehr Experimente, Evaluierungen und technische Änderungen in eine Projektpipeline gelangen. Es könnte aber auch eine größere Aufsichtslast bedeuten, weil die Zahl der zu überprüfenden Aktionen mit dem Umfang der unternommenen Arbeit wächst.

Wenn Aufgaben schwierig wurden, war menschliches Eingreifen meist der Weg nach vorn. In einer Reihe von 588 Aufgaben mit erfasster Schwierigkeit kamen 76 % durch menschliche Hilfe voran, während Agenten 23 % ohne Eingriff lösten. Die häufigsten Formen der Hilfe waren das Bereitstellen von Kontext oder das Präzisieren von Anforderungen mit 35,2 % sowie das Diagnostizieren von Problemen oder das Ändern von Methoden mit 34,7 %.

Menschen übernahmen nur selten direkt die Ausführung. Teilweise Bearbeitungen machten 3,2 % der Eingriffe aus, vollständige Übernahmen 0,7 %. Nachdem Feedback gegeben worden war, erledigten Agenten Überarbeitungen in 75,4 % der Fälle selbst. In der Praxis war der menschliche Engpass also meist Urteilsvermögen und Information – nicht das manuelle Ausführen der Aufgabe.

Das Aufsichtsproblem wächst mit der Agentenaktivität

Die Ergebnisse schließen stärker autonome Modellentwicklung nicht aus. Stattdessen benennen sie ein Kontrollproblem, das schärfer wird, je länger die Agentenketten werden. Wenn keine Person jede Zwischensaktion prüfen kann, könnte menschliche Kontrolle zu einer bloßen Freigabe von Zusammenfassungen oder Endergebnissen werden, statt zu sinnvoller Aufsicht.

Die Forschenden beobachteten außerdem, dass Teilnehmende autonome Modi oft nutzten, um lang laufende Prozesse nicht zu unterbrechen. Diese Grenze wurde dem Bericht zufolge aus Bequemlichkeit gewählt, nicht weil Teams formell festgelegt hätten, wie viel Autorität Agenten erhalten sollen. Für KI-Teams in Unternehmen ist das eine Warnung, dass operative Einstellungen stillschweigend zu Governance-Entscheidungen werden können.

Die Studie verortet aktuelle Systeme zwischen zwei Entwicklungsstufen: KI ist über den Status eines bloßen Forschungsobjekts oder eines engen Werkzeugs für Einzelfunktionen hinausgegangen, ist aber noch nicht eindeutig zu einer unabhängigen Forschungsleitung geworden. Die Autoren beschreiben eine mögliche nächste Stufe als rekursive Selbstverbesserung, in der stärkere Systeme helfen, ihre Nachfolger hervorzubringen, betonen aber zugleich, dass der Weg von besserer Leistung bei Trainingsaufgaben zu besserem Modelldesign ungeklärt bleibt.

Worauf als Nächstes zu achten ist

Die wichtigste Anschlussfrage ist, ob ähnliche Entscheidungsmuster auch in anderen Organisationen und Projekten der Modellentwicklung auftreten. Diese Studie untersuchte die Arbeit eines einzelnen Teams; ihre Beobachtungen sollten daher nicht als universelles Maß für KI-Autonomie gelten.

Forschende und Käufer sollten auf drei Signale achten. Erstens sollten künftige Bewertungen Agentenaktionen klar von Entscheidungen über Ziele, Methoden und Ressourcenzuteilung trennen. Zweitens benötigen Entwicklungsplattformen möglicherweise Prüfprotokolle, die sichtbar machen, wie eine endgültige Empfehlung aus einer langen Agentenkette entstanden ist. Drittens sollten Unternehmen, die automatisierte KI-Forschung behaupten, offenlegen, wie oft Menschen Ziele setzen, Vorschläge ablehnen, Methoden ändern oder nach Fehlern eingreifen.

Die Debatte über rekursive Selbstverbesserung wird zudem von Belegen über Forschungsurteilskraft abhängen, nicht nur von Programmiertempo oder Experimentdurchsatz. Behauptungen von Unternehmen wie Anthropic über zunehmend automatisierte Forschungssteuerung bleiben eine eigene Evidenzkategorie neben diesem unabhängig beschriebenen Projekt und sollten nicht ohne gemeinsame Messgrößen direkt miteinander verglichen werden.

Creati.ai-Perspektive

Die zentrale Lehre dieser Studie ist operativ: Mehr Agentenaktivität bedeutet nicht zwangsläufig mehr Agentenautorität. KI-Agenten können die Zahl der Experimente und Ingenieuraufgaben vervielfachen, die ein Team ausführen kann, während Menschen weiterhin bestimmen, welche Fragen wichtig sind und ob die Ergebnisse eine Richtungsänderung rechtfertigen.

Für Entwickler und Unternehmen ist die unmittelbare Priorität nicht einfach, autonome Durchläufe zu maximieren. Es geht darum, Systeme zu gestalten, die Entscheidungsketten nachvollziehbar machen, Unsicherheit sichtbar machen und es erlauben, die in langen Agentenketten verborgenen Entscheidungen zu überprüfen. Solange Agenten Forschungsziele nicht zuverlässig bewerten können, bevor Ergebnisse vorliegen, bleibt menschliches Urteilsvermögen die knappe Ressource in der Modellentwicklung.

Anzeigen