AIUC hat 40 Millionen Dollar gesammelt, um KI-Agenten auf Unternehmenssicherheit zu zertifizieren und mit Tausenden von Tests Jailbreaks, Halluzinationen und Datenlecks zu bewerten.

Artificial Intelligence Underwriting Company (AIUC), ein Startup, das von einem frühen Anthropic-Mitarbeiter und dem ehemaligen COO der KI-Sicherheitsorganisation METR gegründet wurde, hat 40 Millionen Dollar eingesammelt, um eine unabhängige Test- und Zertifizierungsebene für KI-Agenten aufzubauen.
Die Series A wurde laut TechCrunch von Ribbit Capital angeführt, mit Beteiligung von First Harmonic. Mit dieser Runde beläuft sich die Gesamtfinanzierung von AIUC auf 55 Millionen Dollar, nachdem zuvor über eine Seed-Runde in Höhe von 15 Millionen Dollar berichtet worden war, unterstützt von Nat Friedmans NFDG, Emergence, Terrain und dem Anthropic-Mitgründer Ben Mann.
AIUC zielt auf ein wachsendes Anliegen von Unternehmen ab: ob einem KI-System zuzutrauen ist, innerhalb von Geschäftsabläufen zu arbeiten, nicht nur, ob es Aufgaben erledigen kann. Der vorgeschlagene Standard AIUC-1 orientiert sich teilweise an SOC 2, dem weit verbreiteten Rahmenwerk zur Bewertung von Kontrollen rund um Sicherheit und Geschäftsprozesse.
AIUC wurde von Rune Kvist, einem frühen Anthropic-Mitarbeiter, und Rajiv Dattani gegründet, der von 2024 bis 2025 als COO von METR tätig war und weiterhin im Vorstand der Organisation sitzt, wie TechCrunch berichtet. Die Gründer positionieren das Unternehmen als unabhängigen Prüfer für Firmen, die KI-Agenten entwickeln oder einsetzen.
Das Startup sagt, es habe ein Konsortium aus etwa 250 Sicherheits- und Risikoverantwortlichen zusammengestellt, um zu definieren, was Unternehmenskunden vor dem Kauf eines Agenten wissen möchten. Diese Gespräche fließen in die Tests ein, mit denen AIUC Systeme bewertet, sagte Dattani gegenüber TechCrunch.
AIUC zufolge umfasst sein Testservice rund 5.000 Szenarien zu Themen wie Jailbreaks, Halluzinationen und Datenabfluss. Der Prozess erzeugt einen Bericht von etwa 100 Seiten, der aufzeigt, wo sich das System zuverlässig verhält und wo Käufer Einschränkungen oder zusätzliche Kontrollen anwenden sollten.
Die Tests selbst werden mithilfe von KI-Agenten durchgeführt, und KI wird auch verwendet, um die daraus entstehenden Daten zu analysieren. Laut Kvist prüfen Menschen das abschließende Audit. Diese menschliche Kontrolle ist wichtig, weil ein automatisierter Prüfer dieselben blinden Flecken übernehmen, Modellverhalten falsch interpretieren oder ein subtilsicherheitsrelevantes Problem übersehen kann.
Der Ansatz des Unternehmens spiegelt eine Veränderung darin wider, wie Firmen Enterprise-KI bewerten. Ein Agent, der in einem Benchmark gut abschneidet, kann dennoch für einen Workflow in Finanzen, Gesundheitswesen, Regierung oder Kundenservice ungeeignet sein, wenn er vertrauliche Informationen preisgeben, bösartige Anweisungen befolgen oder eine Handlung außerhalb seiner Berechtigung ausführen kann.
Kvist sagte gegenüber TechCrunch, dass viele Organisationen nicht mehr nur deshalb zögern, weil KI-Modelle zu wenig leistungsfähig sind. Stattdessen brauchen sie Zusicherungen, dass sich Systeme innerhalb der gegenüber Kunden und Aufsichtsbehörden eingegangenen Verpflichtungen verhalten. Der Ansatz von AIUC soll Nachweise liefern, die vor dem Einsatz geprüft werden können, anstatt sich nur auf interne Tests eines Anbieters zu verlassen.
Das Unternehmen listet Cursor, Lovable, Harvey und ElevenLabs als Kunden. Die Quelle liefert keine Details zum Umfang dieser Beziehungen, dazu, welche Produkte bewertet wurden, oder ob die Unternehmen die AIUC-1-Zertifizierung abgeschlossen haben. Diese Nutzungssignale sollten daher als vom Unternehmen berichtet und nicht als unabhängig verifizierte Kundenergebnisse betrachtet werden.
Das Geschäftsmodell von AIUC unterscheidet sich zudem von traditioneller Versicherung, trotz des Wortes „Underwriting“ im Namen. Die Belege beschreiben einen Test- und Zertifizierungsdienst, keinen Schutz vor Verlusten, die durch ein KI-System verursacht werden. Das unmittelbare Produkt ist eine Bewertungsebene, die Beschaffungs- und Einführungsentscheidungen unterstützen soll.
Dattanis Hintergrund bei METR verschafft AIUC eine Verbindung zu einem etablierten Bereich der KI-Bewertung. METR hat mit Frontier-KI-Laboren zusammengearbeitet, um zu messen, ob Agenten Aufgaben zuverlässig erledigen können. Die Forschung wurde auch in Untersuchungen zum Modellverhalten verwendet, einschließlich Arbeiten im Zusammenhang mit dem Hugging-Face-Vorfall bei OpenAI.
AIUC sagt, sein Fokus sei breiter und stärker auf Unternehmen ausgerichtet. Anstatt sich primär auf die Aufgabenerfüllung zu konzentrieren, soll der AIUC-1-Prozess Sicherheits- und Zuverlässigkeitsfehler untersuchen, die auftreten können, wenn Agenten mit realen Geschäftsdaten, Tools und Nutzern interagieren.
Dieser Unterschied ist für Käufer wichtig. Ein System kann eine Aufgabe in einer kontrollierten Bewertung erfolgreich abschließen und dennoch in der Produktion enge Berechtigungen, Überwachung, menschliche Freigaben oder eine eingeschränkte Betriebsumgebung benötigen. Unabhängige Tests könnten Beschaffungsteams beim Vergleich von Systemen helfen, auch wenn eine Zertifizierung nicht garantieren kann, dass ein Agent nach einem Modell-Update, einer Tool-Änderung oder einer neuen Angriffstechnik sicher bleibt.
Auch die breitere Idee externer Bewertung gewinnt bei Unternehmen mit Frontier-Modellen an Aufmerksamkeit. Anthropic-CEO Dario Amodei hat zu größerer Vorsicht in der Frontier-Entwicklung aufgerufen und angedeutet, dass unabhängige Prüfer Sicherheitsarbeit in KI-Laboren beobachten und verifizieren könnten. AIUC schlägt nicht vor, Prüfer bei Kunden vor Ort einzubinden, aber die Gründer verfolgen ein verwandtes Prinzip: Organisationen sollten vor dem Vertrauen in leistungsstarke Systeme Zugang zu unabhängigen Nachweisen haben.
Die Finanzierung ist ein bestätigtes Geschäftsevent, über das TechCrunch berichtet hat, ebenso wie die Gründer von AIUC, der AIUC-1-Standard und der vom Unternehmen beschriebene Testprozess. Die gemeldeten Kundennamen, die Größe des Konsortiums, die Testzahl und die Berichtslänge stammen aus den eigenen Angaben von AIUC im Interview und sollten als Unternehmensbehauptungen verstanden werden.
Es gibt noch nicht genügend Belege, um zu beurteilen, wie gut AIUC-1 Vorfälle in der Produktion vorhersagt, wie konsistent verschiedene Prüfer denselben Agenten bewerten würden oder ob Unternehmen die Zertifizierung als Beschaffungsanforderung behandeln werden. Die Quelle nennt auch keine öffentlichen Auditergebnisse, Fehlerraten, Behebungsresultate, Preise oder den Anteil der bestandenen Tests.
Diese Lücken sind bedeutsam. Sicherheitszertifizierungen werden nützlich, wenn Käufer ihren Umfang verstehen und wenn Bewertungen über die Zeit reproduzierbar sind. KI-Agenten können ihr Verhalten nach Modell-Updates, Tool-Integrationen, Prompt-Änderungen oder Verschiebungen bei den Daten, auf die sie zugreifen können, verändern. Ein einmaliger Bericht kann daher weniger wertvoll sein als eine kontinuierliche Bewertung, die mit Einsatzkontrollen verknüpft ist.
Das erste Signal wird sein, ob AIUC Einzelheiten zu abgeschlossenen AIUC-1-Bewertungen veröffentlicht, einschließlich Methodik, Bewertungskriterien und Beispielen für während der Tests entdeckte Fehler. Käufer werden auch wissen wollen, wie das Unternehmen mit Modell-Updates umgeht und ob eine Zertifizierung erneuert werden muss, wenn sich die Tools oder Berechtigungen eines Agenten ändern.
Ein weiteres wichtiges Signal ist die unabhängige Validierung. Belege von Unternehmenskunden, Sicherheitsforschern oder Prüfern, die nicht mit AIUC verbunden sind, würden helfen zu zeigen, ob die Tests reale Risiken statt nur synthetischer Fehlermodi identifizieren.
Der Markt wird auch zeigen, ob der Ansatz von AIUC Teil der Beschaffung wird. Die Einführung durch große Banken, Krankenhäuser, Regierungsbehörden oder große Softwareplattformen würde darauf hindeuten, dass die Bewertung von Agenten durch Dritte zu einer Standardkontrolle wird. Wenn Unternehmen die Zertifizierung hingegen nur als Marketing-Abzeichen nutzen, ohne aussagekräftige Ergebnisse zu veröffentlichen, bleibt ihr Wert für Entwickler und Käufer begrenzt.
AIUC adressiert einen echten Engpass in der Enterprise-KI: Organisationen brauchen eine belastbare Methode, um zu entscheiden, wo ein Agent autonom handeln kann und wo er Grenzen braucht. Eine strukturierte externe Prüfung könnte diese Entscheidungen greifbarer machen als allgemeine Behauptungen über Modellsicherheit oder allgemeine Leistungsfähigkeit.
Zertifizierung sollte jedoch als Beweis und nicht als Erlaubnis verstanden werden, Schutzmaßnahmen zu entfernen. Die stärkste Version dieses Marktes wird unabhängige Tests mit Live-Überwachung, Zugriff nach dem Prinzip der geringsten Rechte, menschlicher Eskalation und erneuten Bewertungen nach wesentlichen Systemänderungen kombinieren. Die Finanzierung von AIUC verschafft diesem Modell Spielraum zur Entwicklung; seine Glaubwürdigkeit hängt davon ab, ob es zeigen kann, dass die Berichte die Bereitstellungsentscheidungen in der Praxis verbessern.