AIUC lève 40 millions de dollars pour tester et certifier les agents d’IA en entreprise

AIUC a levé 40 millions de dollars pour certifier la sécurité des agents d’IA en entreprise, en utilisant des milliers de tests pour évaluer les jailbreaks, les hallucinations et les fuites de données.

AI News

Artificial Intelligence Underwriting Company (AIUC), une startup fondée par un ancien employé d’Anthropic et l’ancien directeur de l’exploitation de l’organisation de sécurité de l’IA METR, a levé 40 millions de dollars pour construire une couche indépendante de test et de certification pour les agents d’IA.

La série A a été menée par Ribbit Capital, avec la participation de First Harmonic, selon TechCrunch. Cette levée porte le financement total d’AIUC à 55 millions de dollars, après un précédent tour d’amorçage de 15 millions de dollars déjà rapporté et soutenu par NFDG de Nat Friedman, Emergence, Terrain et Ben Mann, cofondateur d’Anthropic.

AIUC cible une préoccupation croissante des entreprises : savoir si un système d’IA peut être digne de confiance au sein des flux de travail métier, et pas seulement s’il peut accomplir des tâches. Son standard proposé AIUC-1 s’inspire en partie de SOC 2, le cadre largement utilisé pour évaluer les contrôles autour de la sécurité et des processus métier.

Une couche de certification pour les agents d’IA

AIUC a été fondée par Rune Kvist, un ancien employé d’Anthropic, et Rajiv Dattani, qui a été directeur de l’exploitation de METR de 2024 à 2025 et siège toujours au conseil d’administration de l’organisation, selon TechCrunch. Les fondateurs positionnent l’entreprise comme un évaluateur indépendant pour les sociétés qui construisent ou déploient des agents d’IA.

La startup affirme avoir rassemblé un consortium d’environ 250 responsables de la sécurité et des risques afin d’aider à définir ce que les acheteurs d’entreprise veulent savoir avant d’acheter un agent. Ces discussions alimentent les tests qu’AIUC utilise pour évaluer les systèmes, a déclaré Dattani à TechCrunch.

AIUC dit que son service de test soumet un agent à environ 5 000 scénarios couvrant des domaines tels que les jailbreaks, les hallucinations et les fuites de données. Le processus produit un rapport d’environ 100 pages, indiquant où le système se comporte de manière fiable et où les acheteurs devraient appliquer des restrictions ou des contrôles supplémentaires.

Les tests eux-mêmes sont exécutés avec l’aide d’agents d’IA, et l’IA est également utilisée pour analyser les données obtenues. Selon Kvist, des personnes vérifient l’audit final. Cette revue humaine est importante, car un évaluateur automatisé peut hériter des mêmes angles morts, mal interpréter le comportement du modèle ou ne pas reconnaître un problème de sécurité subtil.

De la capacité du modèle au risque opérationnel

L’argumentaire de l’entreprise reflète un changement dans la manière dont les entreprises évaluent l’IA d’entreprise. Un agent qui obtient de bons résultats sur un benchmark peut néanmoins être inadapté à un flux de travail dans la finance, la santé, le secteur public ou le service client s’il peut divulguer des informations confidentielles, suivre des instructions malveillantes ou effectuer une action en dehors de son autorisation.

Kvist a déclaré à TechCrunch que de nombreuses organisations ne freinent plus uniquement parce que les modèles d’IA manquent de capacité. Elles ont plutôt besoin d’assurances que les systèmes se comporteront conformément aux engagements pris envers les clients et les régulateurs. L’approche d’AIUC vise à fournir des preuves pouvant être examinées avant le déploiement, plutôt que de s’appuyer uniquement sur les tests internes d’un fournisseur.

L’entreprise cite Cursor, Lovable, Harvey et ElevenLabs parmi ses clients. La source ne fournit pas de détails sur la portée de ces relations, sur les produits évalués, ni sur le fait que les entreprises aient ou non obtenu la certification AIUC-1. Ces signaux d’adoption doivent donc être considérés comme des déclarations de l’entreprise et non comme des résultats clients vérifiés indépendamment.

Le modèle économique d’AIUC diffère également de l’assurance traditionnelle, malgré le mot « underwriting » dans son nom. Les éléments disponibles décrivent un service de test et de certification, et non une couverture des pertes causées par un système d’IA. Son produit immédiat est une couche d’évaluation destinée à soutenir les décisions d’achat et de déploiement.

Comment AIUC se compare aux évaluations de type METR

L’expérience de Dattani chez METR donne à AIUC un lien avec un domaine établi de l’évaluation de l’IA. METR a travaillé avec des laboratoires d’IA de pointe pour mesurer si les agents peuvent accomplir des tâches de manière fiable. Ses recherches ont également été utilisées dans des enquêtes portant sur le comportement des modèles, y compris des travaux liés à l’incident Hugging Face d’OpenAI.

AIUC affirme que son approche est plus large et davantage tournée vers l’entreprise. Plutôt que de se concentrer principalement sur la performance dans les tâches, son processus AIUC-1 est conçu pour examiner les défaillances de sécurité et de fiabilité qui peuvent apparaître lorsque les agents interagissent avec des données, des outils et des utilisateurs réels de l’entreprise.

Cette distinction compte pour les acheteurs. Un système peut réussir une tâche dans une évaluation contrôlée tout en nécessitant en production des autorisations restreintes, une surveillance, une validation humaine ou un environnement d’exploitation limité. Des tests indépendants pourraient aider les équipes achats à comparer les systèmes, même si une certification ne peut pas garantir qu’un agent restera sûr après une mise à jour du modèle, un changement d’outil ou une nouvelle technique d’attaque.

L’idée plus large d’une évaluation externe gagne aussi en attention auprès des entreprises de modèles de pointe. Le PDG d’Anthropic, Dario Amodei, a appelé à davantage de prudence dans le développement de pointe et a suggéré que des évaluateurs indépendants pourraient observer et vérifier les travaux de sécurité dans les laboratoires d’IA. AIUC ne propose pas d’installer des évaluateurs sur les sites des clients, mais ses fondateurs poursuivent un principe connexe : les organisations devraient avoir accès à des preuves indépendantes avant de faire confiance à des systèmes puissants.

Ce que les affirmations montrent — et ce qui reste à prouver

Le financement est un événement commercial confirmé rapporté par TechCrunch, tout comme les fondateurs d’AIUC, son standard AIUC-1 et le processus de test déclaré par l’entreprise. Les noms de clients mentionnés, la taille du consortium, le nombre de tests et la longueur du rapport proviennent des propres déclarations d’AIUC dans l’entretien et doivent être compris comme des affirmations de l’entreprise.

Il n’y a pas encore suffisamment de preuves pour déterminer dans quelle mesure AIUC-1 prédit les incidents en production, avec quelle cohérence différents évaluateurs noteraient le même agent, ou si les entreprises considéreront la certification comme une exigence d’achat. La source n’identifie pas non plus de résultats d’audit publics, de taux d’échec, de résultats de remédiation, de tarification ou la proportion de tests que les agents réussissent.

Ces lacunes sont importantes. Les certifications de sécurité deviennent utiles lorsque les acheteurs comprennent leur portée et lorsque les évaluations sont reproductibles dans le temps. Les agents d’IA peuvent changer de comportement après des mises à jour du modèle, des intégrations d’outils, des modifications de prompts ou des changements dans les données auxquelles ils peuvent accéder. Un rapport ponctuel peut donc être moins utile qu’une évaluation continue liée à des contrôles de déploiement.

Ce qu’il faut surveiller ensuite

Le premier signal sera de savoir si AIUC publie des détails sur les évaluations AIUC-1 terminées, notamment la méthodologie, les critères de notation et des exemples de défaillances découvertes pendant les tests. Les acheteurs voudront également savoir comment l’entreprise gère les mises à jour des modèles et si la certification doit être renouvelée lorsque les outils ou les permissions d’un agent changent.

Un autre signal important est la validation indépendante. Des éléments provenant de clients d’entreprise, de chercheurs en sécurité ou d’auditeurs non affiliés à AIUC aideraient à établir si les tests identifient des risques réels et pas seulement des défaillances synthétiques.

Le marché révélera aussi si l’approche d’AIUC devient partie intégrante des achats. Une adoption par de grandes banques, des hôpitaux, des agences gouvernementales ou de grandes plateformes logicielles indiquerait que l’évaluation d’agents par des tiers devient un contrôle standard. À l’inverse, si les entreprises utilisent la certification comme badge marketing sans publier de résultats significatifs, sa valeur pour les créateurs et les acheteurs restera limitée.

Perspective Creati.ai

AIUC s’attaque à un véritable goulot d’étranglement dans l’IA d’entreprise : les organisations ont besoin d’un moyen défendable de décider où un agent peut agir de manière autonome et où il a besoin de limites. Une évaluation externe structurée pourrait rendre ces décisions plus concrètes que de vagues affirmations sur la sécurité du modèle ou ses capacités générales.

Mais la certification doit être considérée comme une preuve, et non comme une permission de supprimer les garde-fous. La version la plus solide de ce marché combinera des tests indépendants avec une surveillance en temps réel, un accès au moindre privilège, une escalade humaine et des réévaluations après des modifications matérielles du système. Le financement d’AIUC laisse à ce modèle l’espace nécessaire pour se développer ; sa crédibilité dépendra de sa capacité à démontrer que les rapports améliorent concrètement les décisions de déploiement.

Publicités