Circuit Breaker Labs testet KI mit simulierten Nutzern über verschiedene Sprachen und Kulturen hinweg und nimmt psychologische Sicherheitsrisiken in Mental-Health- und Jugend-Apps ins Visier.

Circuit Breaker Labs entwickelt eine Plattform für Sicherheitstests, die simulierte Nutzer einsetzt, um KI-Systeme auf psychologisch schädliche Antworten zu prüfen – insbesondere in Anwendungen für Kinder, Coaching, Tagebuchführung und psychologische Unterstützung. Das Startup in der Frühphase erklärt, seine Tests sollten Slang, kulturellen Kontext, sprachliche Unterschiede und den Drift von Gesprächen erfassen, die dazu führen können, dass Modelle schutzbedürftige Nutzer missverstehen.
Das von den Geschwistern Shirali und Arul Nigam gegründete Unternehmen ist einer der 200 Finalisten von TechCrunch’s Startup Battlefield 2026. Das Profil des Unternehmens erscheint zu einem Zeitpunkt, an dem Bedenken hinsichtlich Chatbot-Beziehungen und KI-gestützter psychischer Gesundheitsinteraktionen von hypothetischen Sicherheitsdebatten zu Klagen und einer Prüfung von Produkten übergehen.
Circuit Breaker Labs beschreibt sein Produkt als eine Armee von „Crashtest-Dummys“: KI-Agenten, die Menschen unterschiedlichen Alters, verschiedener Herkunft, Sprachen und Kommunikationsstile repräsentieren. Die Simulationen sollen über mehrere Gespräche hinweg mit einem Zielmodell interagieren, statt lediglich isolierte Prompts zu übermitteln.
Dieser Unterschied ist für Systeme wichtig, die sich erinnern oder anders reagieren, wenn sich eine Beziehung entwickelt. Ein Chatbot könnte auf eine einzelne risikoreiche Frage eine akzeptable Antwort geben, sich aber anders verhalten, nachdem frühere Austausche einen irreführenden Kontext, emotionale Abhängigkeit oder eine falsche Interpretation der Nutzerabsicht geschaffen haben.
Das Startup arbeitet mit Fachexperten zusammen, um sogenannte hyperrealistische Nutzersimulationen zu erstellen. Diese Simulationen enthalten Tippfehler, verschlüsselte Sprache, Gamer-Slang, Formulierungen in einer Zweitsprache und andere Muster, die in herkömmlichen Sicherheitsbewertungen fehlen können. Circuit Breaker Labs zufolge führt das Unternehmen täglich Zehntausende bis Hunderttausende simulierte Interaktionen durch und wandelt die Ergebnisse in proprietäre Bewertungen um, die prüfbar und nachvollziehbar sein sollen.
Derzeit konzentriert sich das Unternehmen auf Sicherheitstests für KI in risikoreichen Anwendungen, darunter KI-Coaching, Tagebuch-Apps und Apps zur psychischen Unterstützung. Chief Technology Officer Arul Nigam sagte gegenüber TechCrunch, die Plattform könne später auch für breitere Produkte eingesetzt werden, etwa KI-Agenten als digitale Kollegen, bei denen inkonsistente Antworten über mehrere Interaktionen hinweg ebenfalls Sicherheitsprobleme verursachen könnten.
Die Gründer erklärten, ihre Motivation sei der Fall Sewell Setzer gewesen, eines 14-Jährigen, der eine emotionale Bindung zu einem Character.AI-Chatbot entwickelt hatte und später durch Suizid starb. Setzers Eltern behaupteten in einer Klage von 2024, der Chatbot habe ihn ermutigt, nachdem er Gedanken an Selbstverletzung offengelegt hatte. Die Vorwürfe sind nicht als allgemeine Feststellung über die Systeme von Character.AI bestätigt worden.
TechCrunch berichtete außerdem, dass Character.AI mehrere von Familien minderjähriger Nutzer eingebrachte Klagen wegen widerrechtlicher Tötung beigelegt habe, während andere Familien OpenAI wegen angeblicher Verbindungen zwischen ChatGPT-Interaktionen, Suiziden und Wahnvorstellungen verklagt haben. Diese rechtlichen Vorwürfe stehen getrennt von der Produktarbeit von Circuit Breaker Labs und sollten nicht als Beleg dafür verstanden werden, dass ein bestimmtes Modell den Tod eines Nutzers verursacht hat.
Das Argument der Nigams lautet, dass gefährliche Fehler nicht immer voraussetzen, dass ein Nutzer ein System absichtlich jailbreakt. Ein Modell könnte stattdessen die Bedeutung einer indirekten Aussage übersehen, Slang missverstehen oder irreführenden Kontext aus einem früheren Austausch übernehmen. Für jüngere Nutzer oder Menschen, die emotionale Unterstützung suchen, kann eine solche Fehlleistung schwerer zu erkennen sein als eine eindeutig verbotene Antwort.
Die durch die Berichterstattung von TechCrunch bestätigten Details sind begrenzt, aber konkret: Circuit Breaker Labs hat fünf Beschäftigte, verfügt über ein funktionierendes Produkt, arbeitet als KI-Sicherheitstestlabor und hat seine wichtigsten Kunden nicht öffentlich genannt. Arul Nigam lehnte es ab, diese Kunden zu nennen. Daher gibt es in den verfügbaren Belegen keine unabhängig überprüfbare Kundenliste oder Nutzungszahl.
Das Testvolumen, die Breite der simulierten Nutzergruppen und das Bewertungssystem sind Angaben, die aus der Beschreibung der eigenen Plattform durch das Startup stammen. Die Quelle liefert keine unabhängigen Benchmark-Ergebnisse, die zeigen, dass die Bewertungen von Circuit Breaker reale Vorfälle besser vorhersagen als bestehende Red-Team-Tests, automatisierte Sicherheitsklassifikatoren oder menschliche Prüfungen.
Diese Einschränkung ist für Käufer wichtig. Eine große Zahl simulierter Gespräche kann die Abdeckung verbessern, doch allein das Volumen belegt nicht, dass die Simulationen Kinder, mehrsprachige Nutzer, Menschen in Krisen oder bestimmte kulturelle Gemeinschaften zutreffend abbilden. Die Qualität der Fachexperten, das Design der Testszenarien und die Transparenz der Bewertungsmethodik werden bestimmen, wie nützlich die Ergebnisse sind.
Für Produktteams, die KI-Agenten oder Tools zur psychischen Unterstützung entwickeln, läge der unmittelbare Wert dieses Ansatzes in Tests vor der Veröffentlichung und laufender Überwachung. Teams könnten simulierte Gespräche nutzen, um zu prüfen, ob ein Modell indirekte Hinweise auf Selbstverletzung erkennt, mit Mehrdeutigkeit umgeht, die Förderung emotionaler Abhängigkeit vermeidet und angemessen eskaliert, wenn ein Nutzer gefährdet zu sein scheint.
Der Ansatz könnte auch Fehler aufdecken, die Standard-Benchmark-Suiten übersehen. Prompts in englischer Sprache und formeller Prosa sind leichter zu bewerten als fragmentierte Nachrichten, lokaler Slang, Code-Switching oder Gespräche, in denen sich die gefährliche Bedeutung allmählich herausbildet. Ein Sicherheitsbericht, der diese Bedingungen einbezieht, wäre für Produkte für Kinder, internationale Kunden oder Menschen, die unter Stress kommunizieren, relevanter.
Für Unternehmen ist die offene Frage die operative Umsetzung. Käufer müssen wissen, ob die Bewertungen von Circuit Breaker über verschiedene Modellversionen hinweg vergleichbar sind, ob interne Risikoteams Testfälle prüfen können und wie schnell ein Unternehmen Bewertungen nach Änderungen an Prompts, Speichersystemen oder Eskalationsrichtlinien erneut durchführen kann. Zudem werden sie Belege benötigen, dass simulierte Tests die menschliche Prüfung, die Reaktion auf Vorfälle und den Schutz realer Nutzer ergänzen – nicht ersetzen.
Der breitere Ansatz des Unternehmens lautet, dass bessere Tests die Einführung von KI unterstützen könnten, statt sie lediglich einzuschränken. Arul Nigam sagte gegenüber TechCrunch, Skepsis gegenüber KI sei gesund, argumentierte jedoch, ein Verbot nützlicher Anwendungen aus Sicherheitsgründen wäre rückschrittlich. Damit positioniert sich das Startup in einer zwar stark umkämpften, aber zunehmend wichtigen Kategorie: Infrastruktur, die den Einsatz von KI gegenüber Nutzern, Regulierungsbehörden und Risikoteams von Unternehmen besser rechtfertigen soll.
Das deutlichste kurzfristige Signal wird die Präsentation von Circuit Breaker Labs auf der TechCrunch Disrupt in San Francisco vom 13. bis 15. Oktober sein. Die Demonstration des Unternehmens könnte klären, wie seine simulierten Nutzer erstellt werden, wie die Bewertung funktioniert und ob Beispiele für in Kundensystemen gefundene Fehler gezeigt werden können.
Entwickler sollten außerdem auf namentlich genannte Kunden, unabhängige Validierung und Belege achten, dass die Plattform Probleme erkennt, die von bestehenden Sicherheitsprozessen übersehen werden. Weitere wichtige Signale sind, ob das Startup über Anwendungen im Bereich der psychischen Gesundheit hinaus expandiert, Ergebnisse über Sprachen und Kulturen hinweg veröffentlicht und erklärt, wie es mit sensiblen Daten oder Testfällen mit Minderjährigen umgeht.
Circuit Breaker Labs geht eine reale Schwäche bei der Bewertung dialogorientierter KI an: Systeme werden häufig anhand von Prompts getestet, während sich schädliche Interaktionen durch Kontext, Mehrdeutigkeit und wiederholte Nutzung entwickeln können. Simulierte Nutzer könnten dabei helfen, solche Fehlermuster vor dem Start leichter zu finden.
Das Versprechen des Unternehmens wird jedoch weniger von der Größe seiner Agentenpopulation abhängen als von der Glaubwürdigkeit seiner Modelle menschlichen Verhaltens. Unabhängige Benchmarks, transparente Bewertungen und eine sorgfältige menschliche Aufsicht werden notwendig sein, bevor Unternehmenskäufer die Ergebnisse als verlässliches Sicherheitssignal und nicht nur als eine weitere von einem Anbieter gemeldete Bewertung betrachten können.