Ein Mathematiker sagt, OpenAI habe die Forschungsrichtung seines Teams genutzt, um einen umstrittenen Navier–Stokes-Beweis zu verfolgen, was Fragen zur Ethik der KI-Forschung aufwirft.

NYU-Mathematikprofessor Tristan Buckmaster sagt, OpenAI habe sich daran gemacht, einen führenden Ansatz für das Existenz- und Glattheitsproblem der Navier-Stokes-Gleichungen zu verfolgen, nachdem es von Arbeiten erfahren hatte, die er gemeinsam mit dem Anthropic-Mathematiker Levent Alpöge abschloss. Der Streit entstand, als Buckmaster und Alpöge vorläufige Ergebnisse bekannt gaben und OpenAI veröffentlichte, was es als vollständigen Beweis desselben zentralen Problems bezeichnete.
Die Episode verbindet eine potenziell wichtige mathematische Entwicklung mit einer schwierigen Frage für die KI-Forschung: Wenn ein modellunterstütztes Team erfährt, dass externe Forscher einen vielversprechenden Weg gefunden haben, wie weit darf es diese Richtung nutzen, ohne die Arbeit der Forscher unangemessen zu vereinnahmen? Die verfügbaren Belege bestehen vor allem aus Buckmasters Darstellung und OpenAIs eigener Stellungnahme. Im vorliegenden Material gibt es keine unabhängige Bestätigung dafür, dass OpenAIs Beweis korrekt ist oder dass vertrauliche Nutzerdaten verwendet wurden.
Das Existenz- und Glattheitsproblem der Navier-Stokes-Gleichungen ist eines der sieben Millennium-Preisprobleme des Clay Mathematics Institute. Eine korrekte Lösung ist mit einem Preis von 1 Million US-Dollar verbunden und würde eine seit Langem offene Frage zum mathematischen Verhalten von Strömungsgleichungen klären.
Buckmaster kündigte gemeinsam mit Alpöge drei Beweise an und beschrieb sie als vorläufige Ergebnisse, die sich dem umfassenderen Problem annäherten. Ihre Arbeit nutzte mehrere KI-Systeme, vor allem OpenAIs Codex und Anthropics Claude, doch Alpöge handelte unabhängig und nicht im Auftrag von Anthropic.
Laut Buckmasters Erklärung erfuhren die Forscher beim Abschließen ihrer Ergebnisse, dass Informationen über ihren Fortschritt OpenAI erreicht hatten. Er sagt, OpenAI habe ihnen dann mitgeteilt, bereits einen vollständigen Beweis erhalten zu haben. OpenAIs eigene Mitteilung erklärte, der jüngste Versuch habe am 1. September begonnen, nachdem Gerüchte die Runde gemacht hatten, zwei Millennium-Preisprobleme seien gelöst worden.
Dieser Zeitpunkt ist für den Streit zentral. Buckmaster argumentiert, dass der spezielle Weg, den sein Team verfolgte, keine offensichtliche Reaktion auf die Problemstellung war und nur von relativ wenigen Forschern untersucht wurde. Er fand es daher verdächtig, dass OpenAIs Team kurz nach Kenntnis der externen Arbeit dieselbe Richtung eingeschlagen habe, wie er es beschreibt.
Buckmaster sagt, die Gespräche mit OpenAI seien zunehmend unklar geworden, als er fragte, wann das Unternehmen mit seiner Arbeit begonnen habe und wie viel menschliche Anleitung beteiligt gewesen sei. Er behauptet, dass ein großes Team dem Problem zugewiesen worden sei und dass ungewöhnlich viel Rechenleistung eingesetzt worden sei.
Er sagt außerdem, OpenAI-Forscher Sébastien Bubeck habe ihn gebeten, Alpöges Nennung im Rahmen eines möglichen Kompromisses zu entfernen. Buckmaster behauptet weiter, Bubeck habe ihn davor gewarnt, den Streit öffentlich zu machen. Diese Aussagen sind Behauptungen Buckmasters, keine unabhängig verifizierten Fakten in der vorliegenden Berichterstattung.
OpenAIs veröffentlichte Darstellung bestätigt, dass die Arbeit nach dem 1. September begonnen habe, und räumt fortlaufende Gespräche mit Buckmaster und Alpöge ein. Das Unternehmen sagt, sein Beweis unterscheide sich erheblich von der Arbeit der Forscher, einschließlich eines Unterschieds zwischen erzwungenen und un-erzwungenen Formulierungen im Euler-bezogenen Ergebnis.
Das Unternehmen wies auch die Behauptung zurück, seine Forscher oder KI-Agenten hätten die unveröffentlichte Arbeit des Teams vor der öffentlichen Veröffentlichung direkt eingesehen. OpenAI sagte, es seien keine spezifischen Nutzerdaten zur Lösung des Problems abgerufen worden. Gleichzeitig räumte es ein, dass es die Möglichkeit nicht ausschließen könne, dass de-identifizierte, aus Produktnutzung abgeleitete Daten zur Verbesserung seiner Modelle beigetragen hätten.
Diese Einschränkung ist wichtig, weil Buckmaster Codex intensiv nutzte. OpenAI behält sich vor, Modelle auf Codex-Interaktionen zu trainieren, Nutzer können dem jedoch widersprechen. Das Quellenmaterial zeigt nicht, dass Buckmasters Interaktionen in das Training einbezogen wurden, dass ein Modell seine Arbeit reproduzierte oder dass solche Daten OpenAIs Beweis beeinflusst haben.
OpenAI sagt, ein nicht veröffentlichtes Modell der nächsten Generation habe den Beweis nach einer einwöchigen Anstrengung entdeckt, an der 300 Milliarden Ausgabetoken beteiligt waren. TechCrunch berichtete auf Grundlage der damaligen Astra-Preise eine Rechenschätzung von 22,5 Millionen US-Dollar. Das sind berichtete Zahlen und mit dem Unternehmen verknüpfte Behauptungen, keine unabhängig geprüften Messwerte.
Ebenso sollte die Existenz eines „vollständigen Beweises“ nicht als gleichbedeutend mit einer von der Mathematik-Community akzeptierten Lösung behandelt werden. Lösungen für Millennium-Preise erfordern eine detaillierte Verifikation, und die Quellenlage enthält weder eine begutachtete Bewertung noch eine Entscheidung des Clay Mathematics Institute oder eine Bestätigung unabhängiger Mathematiker, dass OpenAIs Argument stichhaltig ist.
Auch Buckmasters und Alpöges Ergebnisse werden als vorläufig beschrieben. Ihre Bedeutung kann letztlich davon abhängen, ob die Arbeit vervollständigt, überprüft und als Lösung der genauen Bedingungen des Navier-Stokes-Problems gezeigt werden kann. In der fortgeschrittenen Mathematik kann ein KI-generiertes Argument wertvoll sein, ohne korrekt, vollständig oder für einen formalen Preis qualifiziert zu sein.
Die Episode umfasst daher zwei getrennte Behauptungen, die nicht vermischt werden sollten. Die eine ist mathematisch: ob eines der Teams eine gültige Lösung vorgelegt hat. Die andere ist verfahrensbezogen: ob OpenAI Informationen verwendet hat, die es durch Gespräche mit den Forschern erhalten hat, oder ihren Ansatz unfair übernommen hat. Keine der beiden Fragen wird allein durch die verfügbaren Stellungnahmen geklärt.
Für KI-Entwickler und Forschungsorganisationen verdeutlicht der Konflikt ein wachsendes Governance-Problem rund um modellunterstützte Entdeckungen. Ein Wissenschaftler, der ein gehostetes Coding- oder Reasoning-System nutzt, kann neuartige Arbeit innerhalb einer Plattform erzeugen, deren Anbieter sich eine gewisse Fähigkeit vorbehält, Interaktionsdaten zur Modellverbesserung zu verwenden. Selbst wenn kein Mitarbeiter direkt die private Arbeit eines Nutzers liest, können Fragen zu Trainingszugriff, Memorierung, Zugriffskontrollen und der Herkunft späterer Ausgaben entstehen.
Der Fall setzt auch Offenlegungspraktiken unter Druck. Teams, die KI-Systeme für originäre Forschung einsetzen, benötigen möglicherweise klarere Aufzeichnungen über Prompts, Modellversionen, Datenaufbewahrungseinstellungen, menschliche Beiträge und den Zeitpunkt, zu dem zentrale Ideen entstanden sind. Solche Aufzeichnungen könnten wichtig werden, wenn mehrere Gruppen ähnliche Ergebnisse melden oder wenn ein Modell einen Beweis erzeugt, nachdem es mit verwandter Forschung in Berührung gekommen ist.
Für Unternehmenskunden ist das praktische Problem nicht auf Mathematik beschränkt. Dieselben Bedenken gelten, wenn Mitarbeitende KI-Tools nutzen, um proprietäre Algorithmen, Produktdesigns, Rechtsstrategien oder wissenschaftliche Erkenntnisse zu entwickeln. Organisationen werden vertragliche Klarheit über die Trainingsnutzung, stärkere Isolation sensibler Sitzungen und Verfahren zur Untersuchung möglicher Überschneidungen zwischen Kundenarbeit und Anbieterforschung wünschen.
Die Geschichte erschwert auch den Wettbewerb zwischen KI-Laboren. Alpöges Beschäftigung bei Anthropic, trotz seiner unabhängigen Rolle in diesem Projekt, scheint institutionelle Spannungen verstärkt zu haben. Wenn Forschende glauben, dass eine Zugehörigkeit zu einem Konkurrenzunternehmen Kredit oder Zugang zur Zusammenarbeit beeinflussen kann, könnte eine unternehmensübergreifende wissenschaftliche Arbeit noch schwieriger werden – gerade dann, wenn sie für die KI-Forschung an der Spitze entscheidend ist.
Das erste Signal wird eine unabhängige mathematische Prüfung von OpenAIs behauptetem Beweis und von Buckmasters und Alpöges vorläufigen Ergebnissen sein. Eine formale Einreichung, öffentliche technische Details oder eine mit dem Clay Mathematics Institute verbundene Bewertung würden helfen, eine echte Lösung von einer beeindruckenden, aber unvollständigen Modellausgabe zu unterscheiden.
Forschende sollten auch auf Dokumentation zur Chronologie der beiden Bemühungen achten: wann OpenAI erstmals relevante Informationen erhielt, was seinen Systemen gezeigt wurde und ob Codex-Interaktionsdaten für das Training infrage kamen. Eine Klärung der von Buckmaster verwendeten Datenaufbewahrungs- und Opt-out-Einstellungen wäre relevant, würde aber für sich genommen noch keine Modellkontamination beweisen.
Schließlich könnte der Streit KI-Labore und akademische Einrichtungen dazu veranlassen, klarere Normen für Zuschreibung, Vertraulichkeit und Priorität zu etablieren, wenn Modelle an Forschung beteiligt sind. Das Ergebnis könnte beeinflussen, wie künftige Entdeckungen dokumentiert werden und wie Wissenschaftler zwischen gehosteten KI-Tools und lokal kontrollierten Systemen wählen.
Die unmittelbare Versuchung besteht darin, dies als Wettbewerb darüber zu rahmen, wer ein berühmtes Problem zuerst gelöst hat. Die folgenreichere Frage ist, ob KI-gestützte Forschung über ausreichende Provenienzregeln verfügt, wenn die Arbeit eines Wissenschaftlers durch einen kommerziellen Modellanbieter läuft. OpenAIs Dementi eines direkten Zugriffs und sein Eingeständnis, dass eine de-identifizierte Beeinflussung nicht ausgeschlossen werden könne, lassen eine Lücke zwischen technischer Möglichkeit und Beweislast.
Bis die mathematischen Behauptungen und der Forschungszeitplan unabhängig geprüft sind, ist die verantwortliche Schlussfolgerung begrenzt: OpenAI hat über eine umfangreiche Beweisinitiative berichtet, während Buckmaster ernsthafte Fragen zu Priorität, Zuschreibung und Datennutzung aufgeworfen hat. Für Entwickler und Unternehmen ist der Fall ein Argument für überprüfbare KI-Workflows – nicht ein Grund anzunehmen, dass gehostete Modelle Nutzer kopieren oder dass modellgenerierte Durchbrüche bereits validiert sind.