Base Labs, Hugging Face und Goodfire entwickeln eine Open-Weight-AI-Sicherheitsinfrastruktur mit dem Ziel, Schutzmaßnahmen transparenter zu machen, während die Modellrisiken wachsen.

Base Labs, die von dem KI-Inferenzunternehmen Baseten gegründete Forschungsgruppe, arbeitet mit Hugging Face und Goodfire AI zusammen, um Sicherheitsinfrastruktur für Open-Weight-Modelle zu entwickeln. Die Initiative soll Sicherheitsbewertung und -überwachung zu einem Teil des Modellentwicklungs- und Bereitstellungsprozesses machen, statt zu einer separaten Schicht, die später hinzugefügt wird.
Die Ankündigung kommt zu einem Zeitpunkt, an dem Entwickler und politische Entscheidungsträger darüber debattieren, wie Modelle zu handhaben sind, deren Gewichte heruntergeladen, verändert und ihrer eingebauten Schutzmechanismen beraubt werden können. Für KI-Entwickler und Enterprise-Teams könnte die Partnerschaft zu einem frühen Testfall dafür werden, ob offene Modell-Ökosysteme glaubwürdige Sicherheitspraktiken etablieren können, ohne sich auf die zentrale Kontrolle durch eine kleine Zahl von Modellanbietern zu stützen.
Base Labs sagt, dass es Methoden für das Training und die Überwachung offener Modelle entwickeln und veröffentlichen wird, mit dem längerfristigen Ziel, einen transparenten Sicherheits-„Standard“ für das Open-Weight-Ökosystem zu schaffen. Hugging Face, eine große Hosting-Plattform für Open-Source- und Open-Weight-Modelle, beteiligt sich an der Initiative, während Goodfire AI Expertise in der Interpretierbarkeit von Modellen einbringt.
Die Unternehmen haben das technische Design der Partnerschaft nicht offengelegt. Dadurch bleiben grundlegende Fragen offen, ob die Arbeit Bewertungs-Benchmarks, Bereitstellungstools, Trainingsmethoden, Überwachungssysteme oder eine Kombination dieser Komponenten hervorbringen wird.
Goodfires erklärter Fokus darauf, das Verhalten von Modellen verständlicher zu machen, legt nahe, dass Interpretierbarkeit Teil des vorgeschlagenen Rahmens sein könnte. In einer Reaktion auf die Ankündigung von Baseten sagte Goodfire, Sicherheit müsse in offene Modelle eingebaut und von den Organisationen bereitgestellt werden, die sie betreiben. Das ist ein breites Ziel, aber noch keine veröffentlichte Spezifikation.
Baseten hat Base Labs Anfang 2026 als Forschungsarm gegründet. Das Unternehmen hat außerdem Entwickler und andere Mitglieder der Forschungsgemeinschaft eingeladen, zum Rahmenwerk beizutragen, was darauf hindeutet, dass das Projekt über die drei Gründungspartner hinausgehen soll.
Der unmittelbare Hintergrund ist die wachsende Sorge, dass Schutzmechanismen aus herunterladbaren Modellen entfernt werden können. TechCrunch berichtete, dass eine als „Abliteration“ bekannte Technik zunehmend eingesetzt wird, um Ablehnungsverhalten und andere Sicherheitskontrollen zu deaktivieren oder zu schwächen. Hugging Face führt laut dem Bericht derzeit mehr als 6.000 Modelle auf, die als abliteriert identifiziert wurden.
Diese Zahl spiegelt den Inhalt und die Kennzeichnung eines Plattformkatalogs wider, nicht eine unabhängige Messung des gesamten offenen Modellmarktes. Sie verdeutlicht jedoch die praktische Schwierigkeit, das ursprüngliche Sicherheitsverhalten eines Modells als dauerhaft zu behandeln, sobald seine Gewichte öffentlich verfügbar sind.
Für Modellentwickler verlagert sich die Sicherheitsfrage dadurch von der Frage, ob ein Anbieter Schutzvorkehrungen eingebaut hat, hin zu der Frage, ob diese Schutzvorkehrungen nach Weiterverbreitung oder Modifikation noch sinnvoll sind. Überwachungstools müssen möglicherweise auch bewerten, wie sich ein Modell unter veränderten Prompts, Fine-Tuning, Quantisierung oder anderen von nachgelagerten Nutzern vorgenommenen Änderungen verhält.
Base Labs argumentiert, dass Offenheit die Sicherheitsforschung verbessern kann, weil Außenstehende das Modellverhalten untersuchen und transparentere Kontrollen entwickeln können. Das ist jedoch die Position des Unternehmens und kein durch diese Partnerschaft belegtes Ergebnis. Offener Zugang kann die Überprüfung verbessern, es kann aber auch erleichtern, Schutzmaßnahmen zu entfernen oder unsichere Varianten zu reproduzieren.
Die bestätigte Ankündigung beschränkt sich auf die Bildung der Partnerschaft und die erklärte Absicht der Unternehmen, Sicherheitsmethoden zu entwickeln und zu veröffentlichen. In der verfügbaren Berichterstattung wurden keine technische Architektur, kein Veröffentlichungszeitplan, keine Evaluationsergebnisse, keine Modellliste und kein Governance-Prozess genannt.
Das konkretste Marktsignal ist der Katalog von Hugging Face mit mehr als 6.000 abliterierten Modellen, wie TechCrunch berichtet. Der Katalog zeigt das Ausmaß der Herausforderung für jeden Ansatz, der Sicherheitsmerkmale über ein offenes Distributionsnetzwerk hinweg erhalten will, belegt jedoch nicht, wie viele dieser Modelle weit verbreitet sind oder ein messbares reales Risiko darstellen.
Auch die finanziellen Ressourcen der Beteiligten liefern Kontext, aber keinen Beweis für technischen Fortschritt. Baseten sammelte im Juni 1,5 Milliarden US-Dollar in einer Series-F-Runde ein und erreichte laut Bericht eine Bewertung von 13 Milliarden US-Dollar. Goodfire AI sammelte Anfang dieses Jahres 150 Millionen US-Dollar in einer von B Capital angeführten Series-B-Runde ein. Diese Zahlen können dem Projekt Zugang zu Engineering- und Forschungskapazitäten verschaffen, validieren aber nicht den vorgeschlagenen Standard oder seine wahrscheinliche Einführung.
Da die verfügbaren Details hauptsächlich aus der Ankündigung der Unternehmen und aus Medienberichten stammen, sollten Aussagen über Transparenz, Beteiligung des Ökosystems und künftige Sicherheitsverbesserungen als erklärte Ziele betrachtet werden. Es gibt bislang keine unabhängigen Benchmark-Ergebnisse, die zeigen, dass der Ansatz schädliche Ausgaben reduziert oder Modelländerungen standhält.
Wenn Base Labs, Hugging Face und Goodfire nutzbare Werkzeuge bereitstellen, könnten Modellentwickler einen gemeinsamen Prozess zum Testen des Verhaltens vor der Veröffentlichung und zum Überwachen von Modellen nach dem Einsatz erhalten. Das könnte Teams dabei helfen, Sicherheitsbewertungen zu dokumentieren, Modellversionen zu vergleichen und Änderungen zu erkennen, die durch Fine-Tuning oder nachgelagerte Verbreitung entstehen.
Für Unternehmenskunden hängt der praktische Nutzen davon ab, ob der Rahmen Nachweise erzeugt, die sich in Beschaffungs-, Risikoprüfungs- und Compliance-Workflows einfügen lassen. Eine Model Card oder ein einmaliger Benchmark könnte für Organisationen, die Modelle einsetzen, die aktualisiert, angepasst oder von verschiedenen Anbietern gehostet werden, unzureichend sein. Käufer werden wahrscheinlich reproduzierbare Tests, Prüfpfade, Versionsverfolgung und klare Informationen darüber benötigen, welche Schutzmechanismen in einem abgeleiteten Modell erhalten bleiben.
Die Partnerschaft versetzt Hugging Face zudem in eine potenziell einflussreiche Position. Als große Plattform für Verbreitung und Entdeckung kann sie dazu beitragen, dass Sicherheitsmetadaten und Evaluationsergebnisse dort sichtbar werden, wo Entwickler Modelle auswählen. Aber Hosting-Infrastruktur allein kann nicht garantieren, dass ein heruntergeladenes Modell seine ursprünglichen Schutzmechanismen behält.
Für Base Labs und Goodfire könnte das Projekt auch eine Wettbewerbsposition in einem Markt schaffen, in dem Modellinferenz, Interpretierbarkeit und Sicherheitstools zunehmend miteinander verknüpft sind. Die Unternehmen müssen zeigen, dass ihr Ansatz für Open-Source-Entwickler praktikabel ist, nicht nur für gut finanzierte Forschungsteams. Werkzeuge, die teuer, langsam oder schwer zu integrieren sind, könnten die Einführung begrenzen, selbst wenn ihre Bewertungen technisch überzeugend sind.
Das erste Signal wird eine öffentliche technische Veröffentlichung sein: eine Spezifikation, eine Benchmark-Suite, ein Trainingsrezept, ein Überwachungstool oder eine Referenzimplementierung. Ihr Umfang wird zeigen, ob die Partnerschaft in erster Linie ein Forschungsprogramm oder ein operativer Standard für den Produktionseinsatz ist.
Entwickler sollten außerdem auf unabhängige Bewertungen von Modellen achten, die im Rahmenwerk getestet wurden, insbesondere nach Fine-Tuning oder Entfernung von Sicherheitskontrollen. Hinweise darauf, dass die Methoden auch in modifizierten Modellen weiterhin riskantes Verhalten erkennen, wären aussagekräftiger als bloße Ankündigungen.
Weitere wichtige Signale sind die Beteiligung von Modellentwicklern außerhalb der Gründungsgruppe, die Integration in Hugging-Face-Workflows, dokumentierte Kosten und Latenzen sowie ein Verfahren zur Aktualisierung von Bewertungen, wenn neue Angriffstechniken auftauchen. Auch die Governance wird wichtig sein: Die Partner haben bisher nicht erklärt, wer akzeptables Verhalten definiert, Streitfälle entscheidet oder das Rahmenwerk pflegt.
Die Partnerschaft adressiert eine reale Schwäche von Open-Weight-KI: Sicherheitskontrollen sind schwer zu bewahren, sobald Modelle kopiert und verändert werden können. Ihre Kernthese – dass Transparenz und geteilte Werkzeuge die Sicherheit verbessern können – ist plausibel, bleibt aber unbewiesen, bis die Unternehmen Methoden veröffentlichen, die andere reproduzieren und überprüfen können.
Für Entwickler und Enterprise-Teams ist die Ankündigung am besten als Infrastrukturvorschlag und nicht als fertige Sicherheitslösung zu verstehen. Die Glaubwürdigkeit von Base Labs, Hugging Face und Goodfire wird weniger von der Partnerschaft selbst abhängen als davon, ob sie offene Evaluierungen, messbare Ergebnisse und Kontrollen liefern, die auch dann noch funktionieren, wenn Modelle ihre ursprüngliche Entwicklungsumgebung verlassen.