Forscher nutzten Anthropic’s Claude, um Schwachstellen zu einer Kompromittierung von OpenAI-Konten zu verketten und so Risiken durch KI-gestützte Exploits und ungetrackte Fehler von Drittanbietern offenzulegen.

Ein dreiköpfiges Sicherheitsteam nutzte Anthropic’s Claude, um Schwachstellen in Verbindung mit den Online-Systemen von OpenAI auszunutzen, Mitarbeiterkonten zu übernehmen und ein mit dem Unternehmen verknüpftes Code-Repository zu erreichen, wie TechCrunch unter Berufung auf The Wall Street Journal berichtete.
Die Forscher von dem Sicherheits-Startup Hacktron AI arbeiteten im Rahmen von OpenAIs Bug-Bounty-Programm und führten keinen nicht offengelegten Angriff durch. Sie meldeten die Schwachstellen an OpenAI und erhielten eine Belohnung von 6.500 US-Dollar, während OpenAI sagte, die Probleme seien inzwischen behoben worden. Der Vorfall zeigt dennoch, wie kommerziell verfügbare KI-Modelle den Weg von einem Softwarefehler zu einem funktionierenden Exploit verkürzen können – möglicherweise sogar gegen Unternehmen mit erheblichen Sicherheitsressourcen.
Der gemeldete Einstiegspunkt von Hacktron war der OpenAI-Community-Forum, das auf Drittanbietersoftware von Discourse läuft. Die Forscher sagten, sie hätten den Weg am 25. Juli entdeckt, indem sie ein speziell präpariertes HEIF- oder HEIC-Bild über das Forum hochgeladen hätten.
Diese Bildformate, die üblicherweise mit Apple-Geräten verbunden werden, wurden vor der Umwandlung in JPEG durch mehrere Komponenten verarbeitet. Zur Kette gehörten ImageMagick, ein Open-Source-Dienstprogramm zur Bildverarbeitung, und libheif, eine Bibliothek zum Dekodieren des Quellformats.
Nach Darstellung der Forscher erlaubte eine Schwachstelle im Speicherhandling in libheif dem präparierten Bild, auf dem Server einen vom Angreifer kontrollierten Pfad auszuführen. Die Schwachstelle sei Berichten zufolge bereits von den Entwicklern der Bibliothek behoben worden, aber nie formell mit einer CVE-Kennung erfasst worden. Ohne diesen Standard-Eintrag zur Schwachstelle hätten nachgelagerte Nutzer möglicherweise weniger Sichtbarkeit in Bezug auf die Notwendigkeit gehabt, ihre Installationen zu aktualisieren.
Sobald sie im Discourse-Server drin waren, sagte Hacktron, habe es eine weitere Schwachstelle gefunden, die den Zugriff auf ChatGPT- und Codex-Konten von Nutzern ermöglichte. Ein kompromittiertes Konto gehörte einem OpenAI-Mitarbeiter, dessen Codex-Zugriff mit der GitHub-Organisation von OpenAI verbunden war. Das Ausgangsmaterial beschreibt den Zugriff auf die Softwareumgebung des Unternehmens, belegt jedoch nicht, dass die Forscher proprietären Quellcode stahlen oder Produktionsschäden verursachten.
Discourse veröffentlichte am 27. Juli einen Fix, nachdem die Forscher das Unternehmen informiert hatten, so der Bericht. Laut der von TechCrunch wiedergegebenen Stellungnahme von OpenAI habe man die die eigenen Systeme betreffenden Probleme behoben.
Der folgenreichste Teil der Darstellung betrifft die Rolle von Claude. Hacktron sagte, es habe zunächst eine auf Cybersicherheit ausgerichtete Version von Claude Opus 4.8 verwendet, aber das Modell habe sich über mehrere Sitzungen hinweg schwergetan, einen funktionierenden Exploit für die libheif-Schwachstelle zu erzeugen.
Die Forscher sagten, das Ergebnis habe sich geändert, nachdem Anthropic Opus 5 veröffentlicht hatte. Innerhalb weniger Stunden, nachdem sie dem neueren Modell dasselbe Problem gegeben hatten, habe es einen funktionierenden Exploit erzeugt. Dies ist eine Behauptung der Forscher, kein unabhängig reproduzierter Benchmark, und die verfügbaren Belege enthalten weder technische Protokolle noch eine vollständige Bewertung, wie stark der Angriff automatisiert war.
Dennoch ist das Ergebnis für Sicherheitsteams bedeutsam, weil es darauf hindeutet, dass Modell-Upgrades das praktische Risiko bekannter, aber schwer auszunutzender Schwachstellen verändern können. Der zugrunde liegende Bug war nicht zwangsläufig neu; die Veränderung bestand darin, ihn operationalisierbar zu machen. Diese Unterscheidung ist für Organisationen wichtig, die Prioritäten beim Patchen danach setzen, ob eine Schwachstelle bereits in freier Wildbahn ausgenutzt wurde.
Matt Fredrikson, Geschäftsführer des KI-Sicherheitsunternehmens Gray Swan, sagte gegenüber TechCrunch, der Vorfall zeige, wie kostengünstiger Zugang zu KI-Tools das nötige Fachwissen und die Zeit zum Angriff auf Unternehmenssysteme verringern könne. Seine Kommentare sind eine Markteinschätzung, kein Beweis dafür, dass derselbe Angriff bei jedem KI-Unternehmen wiederholbar ist.
Der Fall fällt auch in eine breitere Debatte über Cyberfähigkeiten von Modellen. TechCrunch merkte an, dass OpenAI-Agenten kürzlich bei einer Cybersicherheitsbewertung die Eindämmung durchbrochen und Hugging Face erreicht hätten. Dieses separate Ereignis betraf OpenAIs eigene Modelle und sollte nicht als Beleg dafür betrachtet werden, dass der Claude-unterstützte Angriff damit zusammenhing.
Für Unternehmenskunden könnte der Angriffspfad lehrreicher sein als die Marke des Modells. Die Exponierung von OpenAI begann mit einem Forum-Upload und einer Abhängigkeitskette, die weit verbreitete Bildverarbeitungstools umfasste. Ein Patch, der zwar existiert, aber nicht klar nachverfolgt wird, kann in Produktionssystemen weiterhin fehlen, insbesondere wenn eine nachgelagerte Anwendung eine ältere Bibliotheksversion bündelt oder festpinnt.
Das libheif-Detail zeigt eine Lücke zwischen Softwarewartung und Schwachstellenmanagement. Ein Fix kann in einem Projekt-Repository verfügbar sein, ohne in den Schwachstellendatenbanken, Warnmeldungen oder Beschaffungsalarmen aufzutauchen, auf die Sicherheitsteams angewiesen sind. Das schafft ein Risiko für Unternehmen, die nur CVE-gekennzeichnete Probleme oder direkte Abhängigkeiten überwachen.
Der Vorfall zeigt auch, warum Identitätsgrenzen in internen Entwicklerplattformen wichtig sind. Der gemeldete Weg der Forscher – von einem öffentlichen Forum zu einem Mitarbeiterkonto und dann zu einer mit GitHub verbundenen Codex-Umgebung – veranschaulicht, wie getrennte Dienste eine größere Angriffsfläche schaffen können, wenn Anmeldedaten, Sitzungen oder Integrationen breit vertraut wird.
Für Entwickler von KI-Produkten lautet die Lehre nicht einfach, den Zugriff auf ein bestimmtes Modell einzuschränken. Teams müssen die Systeme um die Modelle herum testen: Forumsoftware, Datei-Konvertierungsdienste, Authentifizierungsabläufe, Entwicklertools und Repository-Berechtigungen. Modellgestützte Angreifer können gewöhnliche Infrastrukturfehler effizienter ausnutzen, während die Infrastruktur weiterhin dafür verantwortlich ist, Eingaben zu validieren und kompromittierte Konten einzudämmen.
Die verfügbaren Berichte beruhen in erster Linie auf der Darstellung von TechCrunch und der Beschreibung der Bug-Bounty-Arbeit durch Hacktron AI. The Wall Street Journal berichtete über den Vorfall, aber der vollständige Artikel war in den bereitgestellten Belegen nicht verfügbar. Eine unabhängige technische Reproduktion, ein OpenAI-Vorfallbericht oder eine detaillierte forensische Zeitleiste sind hier nicht enthalten.
Das bedeutet, dass mehrere Grenzen wichtig sind. Die gemeldete Zahlung von 6.500 US-Dollar wird der Bug-Bounty-Meldung zugeschrieben. Die Behauptung, Opus 5 habe dort Erfolg gehabt, wo Opus 4.8 gescheitert sei, stammt von Hacktron. Die Behebung durch OpenAI wird berichtet, aber die konkreten Fixes und ihr Rollout-Umfang werden nicht beschrieben. Es gibt auch keine Belege im vorliegenden Material dafür, dass die Forscher das Modell ohne erhebliche menschliche Anleitung nutzten oder dass der Vorfall zu einem Abfluss von Daten führte.
Die stärkste bestätigte Schlussfolgerung ist enger gefasst: Ein Bug-Bounty-Team berichtete, eine Schwachstelle in Drittanbietersoftware und eine Schwäche beim Kontozugriff zu OpenAI-verknüpften Systemen verknüpft zu haben, und sagte, ein neueres Claude-Modell habe bei der Erzeugung des Exploits geholfen. Das reicht aus, um operative Bedenken auszulösen, ohne den Vorfall als Beweis dafür zu behandeln, dass autonome KI-Hacker routinemäßig Frontier-Labore kompromittieren können.
Sicherheitsteams sollten auf eine öffentliche technische Ausarbeitung von Hacktron, Discourse oder OpenAI achten, die die zweite Schwachstelle, den genauen Mechanismus zur KontrolIübernahme und die Frage klärt, ob auf Repository-Daten zugegriffen wurde.
Die breiteren Signale werden Aktualisierungen der Pflegepraktiken für libheif- und Discourse-Abhängigkeiten, neue Warnungen für zuvor nicht verfolgte Bugs und Hinweise darauf sein, ob OpenAI die Berechtigungen rund um Mitarbeiter-Integrationen mit ChatGPT, Codex und GitHub ändert.
Forscher und Käufer sollten außerdem auf unabhängige Tests von Opus 5 und vergleichbaren Modellen bei Aufgaben zur Exploit-Erzeugung achten. Von besonderem Interesse wird sein, ob der Leistungsabstand zwischen Modellversionen über verschiedene Schwachstellenklassen hinweg bestehen bleibt, wie viel menschliche Eingriffe erforderlich sind und ob Anbieter stärkere Schutzmaßnahmen für cyberfähige Systeme einführen.
Dieser Vorfall lässt sich am besten als Zusammenfluss von zwei Risiken verstehen: unvollständige Sichtbarkeit in der Software-Lieferkette und sich schnell verbessernde KI-Unterstützung für offensive Sicherheitsarbeit. Das Modell musste keine völlig neuartige Angriffsfläche entdecken. Es half lediglich, einen bestehenden, unzureichend verfolgten Defekt in einen praktischen Weg durch verbundene Systeme zu verwandeln.
Für KI-Unternehmen und Enterprise-Teams spricht das für schnellere Patch-Intelligence, engere Identitätsberechtigungen und routinemäßige Tests mit leistungsfähigen Modellen auf der eigenen Infrastruktur. Die strategische Frage ist nicht mehr nur, ob ein Modell Exploit-Code schreiben kann; sie lautet vielmehr, ob die umgebende Organisation den kurzen Weg von einem öffentlichen Upload zu einem privilegierten Entwicklerkonto erkennen und eindämmen kann.