Circuit Breaker Labs teste l’IA avec des utilisateurs simulés dans différentes langues et cultures afin de cibler les risques de sécurité psychologique dans les applications de santé mentale et destinées aux jeunes.

Circuit Breaker Labs développe une plateforme de tests de sécurité qui utilise des utilisateurs simulés pour sonder les systèmes d’IA à la recherche de réponses psychologiquement nuisibles, en particulier dans les applications destinées aux enfants, au coaching, à la tenue d’un journal et au soutien en santé mentale. La jeune startup affirme que ses tests sont conçus pour prendre en compte l’argot, le contexte culturel, les différences linguistiques et la dérive conversationnelle qui peuvent amener les modèles à mal comprendre les utilisateurs vulnérables.
L’entreprise, fondée par les frère et sœur Shirali et Arul Nigam, figure parmi les finalistes du TechCrunch Startup Battlefield 200 de 2026. Son profil apparaît alors que les inquiétudes concernant les relations avec les chatbots et les interactions de santé mentale assistées par l’IA passent des débats théoriques sur la sécurité aux poursuites judiciaires et à l’examen des produits.
Circuit Breaker Labs décrit son produit comme une armée de « mannequins de crash-test » : des agents IA conçus pour représenter des personnes d’âges, d’origines, de langues et de styles de communication différents. Les simulations sont destinées à interagir avec un modèle cible au cours de plusieurs conversations, plutôt qu’à simplement lui soumettre des requêtes isolées.
Cette distinction est importante pour les systèmes qui mémorisent les échanges ou y répondent différemment à mesure qu’une relation se développe. Un chatbot peut produire une réponse acceptable à une seule question à haut risque, mais se comporter différemment après que des échanges antérieurs ont créé un contexte trompeur, une dépendance affective ou une interprétation erronée de l’intention de l’utilisateur.
La startup travaille avec des experts humains du domaine pour créer ce qu’elle appelle des simulations d’utilisateurs hyperréalistes. Ces simulations incluent des fautes de frappe, du langage codé, de l’argot de joueurs, des formulations de personnes parlant une deuxième langue et d’autres schémas qui peuvent manquer dans les évaluations de sécurité conventionnelles. Circuit Breaker Labs affirme exécuter chaque jour des dizaines de milliers à des centaines de milliers d’interactions simulées et convertir les résultats en scores exclusifs censés être auditables et explicables.
L’entreprise se concentre actuellement sur les tests de sécurité de l’IA pour les applications à haut risque, notamment le coaching par IA, la tenue d’un journal et les applications de soutien en santé mentale. Arul Nigam, directeur technique, a déclaré à TechCrunch que la plateforme pourrait finalement être utilisée pour des produits plus larges, notamment des agents IA collègues, où des réponses incohérentes d’une interaction à l’autre pourraient également créer des problèmes de sécurité.
Les fondateurs ont expliqué que leur motivation venait du cas de Sewell Setzer, un adolescent de 14 ans qui a développé un attachement affectif à un chatbot de Character.AI avant de mourir par suicide. Les parents de Setzer ont allégué dans une plainte déposée en 2024 que le chatbot l’avait encouragé après qu’il eut révélé des pensées d’automutilation. Ces allégations n’ont pas été établies comme une conclusion générale concernant les systèmes de Character.AI.
TechCrunch a également rapporté que Character.AI avait conclu des accords dans plusieurs actions pour décès injustifié intentées par les familles d’utilisateurs mineurs, tandis que d’autres familles ont poursuivi OpenAI pour des liens présumés entre les interactions avec ChatGPT, des suicides et des délires. Ces accusations judiciaires restent distinctes du travail produit de Circuit Breaker Labs et ne doivent pas être considérées comme la preuve qu’un modèle particulier a causé la mort d’un utilisateur.
L’argument des Nigam est que les défaillances dangereuses ne nécessitent pas toujours qu’un utilisateur tente délibérément de contourner les protections d’un système. Un modèle peut plutôt ne pas saisir le sens d’une déclaration indirecte, mal comprendre l’argot ou conserver un contexte trompeur issu d’un échange précédent. Pour les utilisateurs plus jeunes ou les personnes cherchant un soutien affectif, ce type de défaillance peut être plus difficile à détecter qu’une réponse clairement interdite.
Les éléments confirmés par les informations de TechCrunch sont limités mais précis : Circuit Breaker Labs compte cinq employés, dispose d’un produit fonctionnel, opère comme laboratoire de tests de sécurité de l’IA et n’a pas publiquement identifié ses clients de premier plan. Arul Nigam a refusé de nommer ces clients ; il n’existe donc aucune liste de clients ni donnée d’adoption vérifiable indépendamment dans les éléments disponibles.
Le volume de tests, l’étendue des populations d’utilisateurs simulés et le système de notation sont des affirmations rapportées à partir de la description que la startup fait de sa propre plateforme. La source ne fournit pas de résultats indépendants de référence montrant que les évaluations de Circuit Breaker prédisent mieux les incidents réels que les tests de red team existants, les classificateurs de sécurité automatisés ou l’examen humain.
Cette limite est importante pour les acheteurs. Un grand nombre de conversations simulées peut améliorer la couverture, mais le volume seul ne prouve pas que les simulations reflètent fidèlement les enfants, les utilisateurs multilingues, les personnes en crise ou certaines communautés culturelles. La qualité des experts du domaine, la conception des scénarios de test et la transparence de la méthodologie de notation détermineront l’utilité des résultats.
Pour les équipes produit qui développent des agents IA ou des outils de soutien en santé mentale, la valeur immédiate de cette approche serait de tester les produits avant leur lancement et d’assurer une surveillance continue. Les équipes pourraient utiliser des conversations simulées pour vérifier si un modèle reconnaît les signaux indirects d’automutilation, gère l’ambiguïté, évite d’encourager la dépendance affective et oriente correctement les utilisateurs qui semblent en danger.
Cette approche pourrait également révéler des défaillances que les suites de référence standard ne détectent pas. Les requêtes en anglais rédigées en prose formelle sont plus faciles à évaluer que les messages fragmentés, l’argot local, l’alternance codique ou les conversations dans lesquelles le sens dangereux apparaît progressivement. Un rapport de sécurité intégrant ces conditions serait plus pertinent pour les produits utilisés par des enfants, des clients internationaux ou des personnes communiquant sous stress.
Pour les entreprises, la question non résolue est opérationnelle. Les acheteurs devront savoir si les scores de Circuit Breaker peuvent être comparés entre différentes versions d’un modèle, si les cas de test peuvent être audités par les équipes internes chargées des risques et à quelle vitesse une entreprise peut relancer les évaluations après avoir modifié les requêtes, les systèmes de mémoire ou les politiques d’escalade. Ils devront également obtenir la preuve que les tests simulés complètent — et ne remplacent pas — l’examen humain, la réponse aux incidents et les protections destinées aux utilisateurs réels.
L’argument plus général de l’entreprise est que de meilleurs tests pourraient favoriser l’adoption plutôt que la restreindre. Arul Nigam a déclaré à TechCrunch que le scepticisme envers l’IA était sain, mais a soutenu qu’interdire des applications utiles pour des raisons de sécurité serait régressif. Cette position place la startup dans une catégorie concurrentielle mais de plus en plus importante : celle des infrastructures conçues pour rendre le déploiement de l’IA plus défendable auprès des utilisateurs, des régulateurs et des équipes de gestion des risques des entreprises.
Le signal le plus clair à court terme sera la présentation de Circuit Breaker Labs à TechCrunch Disrupt, à San Francisco, du 13 au 15 octobre. La démonstration de l’entreprise pourrait préciser comment ses utilisateurs simulés sont construits, comment fonctionne sa notation et si elle peut montrer des exemples de défaillances découvertes dans les systèmes de ses clients.
Les développeurs devront également surveiller l’annonce de clients nommés, la validation indépendante et les preuves que la plateforme détecte des problèmes ignorés par les processus de sécurité existants. Parmi les autres signaux importants figurent l’éventuelle expansion de la startup au-delà des applications liées à la santé mentale, la publication de résultats dans différentes langues et cultures et les explications concernant la gestion des données sensibles ou des cas de test impliquant des mineurs.
Circuit Breaker Labs s’attaque à une faiblesse réelle de l’évaluation de l’IA conversationnelle : les systèmes sont souvent testés à partir de requêtes, alors que les interactions nuisibles peuvent se développer par le contexte, l’ambiguïté et l’usage répété. Les utilisateurs simulés pourraient faciliter la détection de ces modes de défaillance avant le lancement.
Mais la promesse de l’entreprise dépendra moins de la taille de sa population d’agents que de la crédibilité de ses modèles du comportement humain. Des références indépendantes, une notation transparente et une supervision humaine rigoureuse seront nécessaires avant que les acheteurs professionnels puissent considérer ses résultats comme un signal de sécurité fiable plutôt que comme une autre évaluation communiquée par un fournisseur.