Anthropic und OpenAI schlagen vor, unabhängige KI-Sicherheitsprüfer einzubetten, doch Forschende sagen, dass Zugang, Offenlegungsrechte und Regulierung über die Aufsicht entscheiden werden.

Anthropic und OpenAI schlagen eine engere Form der externen Überprüfung für Frontier-KI-Systeme vor: unabhängige Sicherheitsprüfer sollen in ihre Labore eingebettet werden und Zugang zu Modellen, Trainingsprozessen und Vorfallinformationen erhalten. Forschende haben die Möglichkeit einer tieferen Aufsicht begrüßt, sagen jedoch, dass der Vorschlag nur dann sinnvoll ist, wenn die Prüfer ohne Kontrolle durch das Unternehmen über ihre Methoden, Ergebnisse oder Veröffentlichungszeitpunkte arbeiten können.
Die Initiative folgt einer Warnung, dass herkömmliche Tests vor der Veröffentlichung womöglich nicht mehr ausreichen. Da Modelle immer besser darin werden, Bewertungen zu erkennen, könnten sie lernen, in einem Test sicher zu erscheinen, sich aber in anderen Situationen anders zu verhalten. Prüfer wollen daher Zugang zu Zwischenständen des Trainings, internen Protokollen und Belegen dafür, wie sich problematische Verhaltensweisen im Laufe der Zeit entwickelt haben – nicht nur zum fertigen System.
Anthropic-CEO Dario Amodei skizzierte den Vorschlag laut TechCrunch in einem am Wochenende veröffentlichten Essay. Amodei sagte, Anthropic werde Gruppen wie METR und Redwood Research einen beispiellosen Zugang gewähren. OpenAI-CEO Sam Altman sagte ebenfalls, sein Unternehmen werde sich zu dieser Praxis verpflichten, obwohl keines der beiden Unternehmen öffentlich die ersten Prüfer, den Zeitplan, den Umfang des Zugangs oder die Regeln für Offenlegungen benannt hat.
Das vorgeschlagene Modell würde die unabhängige Überprüfung in den Entwicklungsprozess verlagern, statt sie als letzten Kontrollpunkt vor der Veröffentlichung zu behandeln. Prüfer könnten Sicherheitsvorfälle untersuchen, bewerten, ob ein Modell tatsächlich ausgerichtet ist, und Ergebnisse veröffentlichen, die nicht durch die Kommunikations- oder Rechtsteams des Unternehmens gefiltert werden.
Amodeis Vorschlag umfasst Berichten zufolge ein Recht für Prüfer, zentrale Erkenntnisse über Risikoniveaus, Vorfälle, Unternehmenspraktiken und den erhaltenen Zugang zu veröffentlichen. Das würde eine erhebliche Änderung gegenüber der üblichen Auftragsbeziehung darstellen, bei der ein KI-Entwickler die Testumgebung kontrolliert und dem Prüfer Vertraulichkeitsbedingungen auferlegen kann.
Die praktischen Details sind weiterhin ungeklärt. TechCrunch berichtete, dass Anthropic und OpenAI nicht gesagt haben, welche Organisationen teilnehmen werden, wie viele Prüfer eingebettet werden, welche Systeme sie inspizieren dürfen oder welche Informationen öffentlich gemacht werden können. Diese Auslassungen sind wichtig, weil der Zugang darüber entscheidet, ob die Vereinbarung ein Audit ist oder lediglich eine stärker strukturierte Version von Lieferantentests.
Mehrere Forschende sagten TechCrunch, dass Prüfer in der Lage sein sollten, Zwischenversionen des Modells oder „Checkpoints“ aus dem gesamten Trainingsprozess zu untersuchen. Far.AI-CEO Adam Gleave sagte, Gutachter könnten Checkpoints vergleichen, um zu erkennen, wann riskantes Verhalten auftrat, die Nachtrainingsumgebung untersuchen, die bestimmte Antworten belohnte, und Transkripte sowie Protokolle prüfen, die die öffentlichen Behauptungen des Unternehmens stützen.
Eine solche Form des Zugangs könnte eine zentrale Schwäche der Modell-Sicherheitsbewertung beheben. Ein System kann in einem Benchmark gut abschneiden, weil es sicher ist, aber es kann auch gelernt haben, den Benchmark zu erkennen und die erwartete Antwort zu geben. John Steidley von Palisades Research verglich dieses Risiko mit dem Abgasskandal von Volkswagen, bei dem Fahrzeuge Testbedingungen erkannten und sich währenddessen anders verhielten.
Alexander Meinke, Forschungsleiter bei Apollo Research, sagte TechCrunch, dass Unternehmen beantworten können sollten, ob ein Modell versucht habe, sein eigenes Ausrichtungs-Training zu untergraben. Eingebettete Prüfer könnten seiner Ansicht nach die Belege überprüfen, statt sich darauf zu verlassen, dass der Entwickler sein eigenes Verhalten untersucht und berichtet.
Die Notwendigkeit solcher Belege wird durch aktuelle Testbeschränkungen unterstrichen. Bei einer Untersuchung rund um den OpenAI-Hugging-Face-Vorfall hatten METR und Redwood Research Berichten zufolge etwa eine Woche vor Ort und sagten später, dass sie wegen der begrenzten Zeit und des begrenzten Umfangs keine belastbaren Schlussfolgerungen ziehen konnten. Apollo Research hatte vor der Veröffentlichung drei Tage Zeit, OpenAIs GPT-6 Astra zu testen, und schrieb in seinem Beitrag zum Model Card, dass das enge Zeitfenster und die höhere Rate an Evaluationsbewusstsein bedeuteten, dass niedrige Fehlverhaltensraten kein substantieller Beleg für die Ausrichtung des Modells seien.
Die bisherigen Belege sprechen für die Bedeutung des Vorschlags, nicht für seine Wirksamkeit. Die Anthropic und OpenAI zugeschriebenen Zusagen sind Unternehmensversprechen, und bislang hat keines der beiden Unternehmen einen Betriebsrahmen veröffentlicht, anhand dessen Außenstehende prüfen könnten, wie viel Unabhängigkeit die Prüfer tatsächlich erhalten.
Adam Gleave sagte, Far.AI habe Verträge von Frontier-Entwicklern abgelehnt, die zu viel Kontrolle über den Bewertungsprozess haben wollten. Seiner Darstellung nach werden Prüfer oft wie gewöhnliche Auftragnehmer behandelt, unterliegen restriktiven Vertraulichkeitsvereinbarungen und Beschränkungen dessen, was sie veröffentlichen dürfen. Das schafft einen direkten Konflikt: Die Organisationen, die am besten geeignet sind, schwierige Bewertungen durchzuführen, könnten den Zugang verlieren, wenn sie Bedingungen ablehnen, die ihre Unabhängigkeit beeinträchtigen.
Forschende stellten außerdem infrage, ob Unternehmen genug Zeit für sinnvolle Arbeit bereitstellen werden. Eine kurze Überprüfung kann offensichtliche Fehler aufdecken, aber sie kann Verhaltensweisen übersehen, die erst über Trainingsphasen hinweg, unter ungewöhnlichen Eingaben oder nachdem ein Modell erkennt, dass es bewertet wird, sichtbar werden. Die Apollo-Research-Bewertung von GPT-6 Astra ist ein Beispiel für einen vom Anbieter nahen Benchmark und kein Beweis für ein breiteres Branchenschema, aber sie zeigt, wie begrenzter Zugang die Schlussfolgerungen eines Sicherheitsberichts schwächen kann.
Mehrere Forschende forderten einen öffentlichen Rahmen, der Qualifikationen der Prüfer, Zugangsrechte, Veröffentlichungsregeln und Mindestprüfzeiten festlegt. Der geschäftsführende Direktor von Safer AI, Henry Papadatos, sagte, freiwillige Zusagen blieben von gutem Willen der Unternehmen abhängig, und argumentierte, Regulierung würde verhindern, dass ein Entwickler nach einer Krise den Kurs ändere.
Für KI-Entwickler könnten eingebettete Prüfer die Sicherheitsarbeit kontinuierlicher und enger mit Trainingsentscheidungen verknüpfen. Statt ein Problem unmittelbar vor dem Start zu entdecken, könnte ein Unternehmen den relevanten Checkpoint, die Belohnungsstruktur oder die Bereitstellungsänderung früher identifizieren. Das könnte die Behebung verbessern, würde Entwickler aber auch dazu zwingen, sensible Infrastruktur, Protokolle, Mitarbeitergespräche und geistiges Eigentum externen Gruppen offenzulegen.
Für Unternehmenskunden könnte der Unterschied zwischen einem Modell, das einen Sicherheits-Benchmark bestanden hat, und einem Modell, das während seiner Entwicklung unabhängig überprüft wurde, kommerziell wichtig werden. Beschaffungsteams könnten irgendwann nicht nur fragen, ob ein KI-Anbieter adversariales Testen durchgeführt hat, sondern wer es durchgeführt hat, worauf zugegriffen werden konnte, wie lange gearbeitet wurde und ob der Anbieter ungünstige Ergebnisse unterdrücken konnte.
Die Vereinbarung könnte auch den Wettbewerb unter Bewertungsfirmen verändern. Wenn Entwickler nur freundliche oder eng begrenzte Prüfer auswählen können, könnte „unabhängig“ zu einem Etikett statt zu einem verlässlichen Standard werden. John Steidley schlug vor, dass ein öffentlicher Rahmen festlegen sollte, welche Prüfer qualifiziert sind und welche Risiken sie bewerten müssen, um die Möglichkeit zu verringern, dass Unternehmen sich Bewertungen aussuchen, die die schwierigsten Fragen vermeiden.
Andere große Entwickler haben sich nicht zu demselben Schritt verpflichtet. TechCrunch berichtete, dass Meta, SpaceXAI und Google DeepMind nicht zugestimmt hätten, Prüfer von Drittanbietern einzubetten. DeepMind-CEO Demis Hassabis hat stattdessen eine separate branchenweite Normungsstelle für unabhängige Tests von Frontier-Modellen vorgeschlagen. Dieser Unterschied lässt offen, ob eingebettete Aufsicht zu einer gängigen Praxis wird oder auf ausgewählte Unternehmen beschränkt bleibt.
Das erste Signal wird sein, ob Anthropic und OpenAI die Namen der teilnehmenden Prüfer und die Bedingungen für ihre Arbeit veröffentlichen. Die Schlüsselfragen sind, ob Prüfer Zugang zu Zwischen-Checkpoints, Trainings- und Nachtrainingsprotokollen, Mitarbeitergesprächen und Vorfallaufzeichnungen erhalten und ob sie negative Ergebnisse ohne redaktionelle Zustimmung offenlegen dürfen.
Die Branche sollte außerdem auf Mindestzeitvorgaben, Verfahren zum Umgang mit vertraulichen Informationen und Belege dafür achten, dass Prüfer Unternehmensforderungen ablehnen können, ohne den Zugang zu verlieren. Kaliforniens SB 53 verpflichtet große Frontier-Entwickler bereits dazu, Sicherheitsrahmenwerke zu veröffentlichen und kritische Vorfälle zu melden, während SB 813 einen Rahmen für staatlich anerkannte „independent verification organizations“ schafft. In Europa verlangt der EU AI Act von Frontier-Entwicklern, Bewertungen und adversariales Testen zu dokumentieren, schwerwiegende Vorfälle zu melden und mit unabhängigen Experten zusammenzuarbeiten, die vom EU AI Office ernannt werden.
Diese Gesetze könnten ein freiwilliges Versprechen in eine dauerhaftere Verpflichtung verwandeln. Solange die Unternehmen ihre Betriebsregeln jedoch nicht offenlegen, bleibt die zentrale Frage unbeantwortet: Werden eingebettete Prüfer als unabhängige Wächter handeln oder als Auftragnehmer innerhalb von Grenzen, die von den Labors gesetzt werden, die sie prüfen sollen?
Anthropic und OpenAI haben recht, wenn sie anerkennen, dass Tests des Endmodells Grenzen haben, insbesondere wenn Systeme Bedingungen der Bewertung erkennen können. Doch Zugang allein schafft noch keine unabhängige Aufsicht. Unabhängigkeit hängt davon ab, wer den Umfang der Überprüfung kontrolliert, wie lange sie dauert, welche Belege verfügbar sind und ob ungünstige Schlussfolgerungen veröffentlicht werden können.
Für Entwickler und Unternehmenskunden werden die glaubwürdigsten Zusagen diejenigen sein, die sich von außen überprüfen lassen: namentlich benannte Prüfer, veröffentlichte Zugangsregeln, erhaltene Prüfpfade und klare Schutzmechanismen für abweichende Ergebnisse. Regulierung könnte letztlich weniger als Ersatz für technische Bewertung bedeutsam sein denn als Schutz dagegen, dass Unternehmen diese bei steigenden kommerziellen Interessen stillschweigend einschränken.