Circuit Breaker Labs está probando la IA con usuarios simulados en distintos idiomas y culturas, con el objetivo de detectar riesgos de seguridad psicológica en aplicaciones de salud mental y para jóvenes.

Circuit Breaker Labs está desarrollando una plataforma de pruebas de seguridad que utiliza usuarios simulados para examinar los sistemas de IA en busca de respuestas psicológicamente dañinas, especialmente en aplicaciones dirigidas a niños, coaching, diarios personales y apoyo para la salud mental. La startup en fase inicial afirma que sus pruebas están diseñadas para captar la jerga, el contexto cultural, las diferencias lingüísticas y la deriva conversacional que pueden hacer que los modelos malinterpreten a usuarios vulnerables.
La empresa, fundada por los hermanos Shirali y Arul Nigam, es una de las finalistas de TechCrunch Startup Battlefield 200 de 2026. Su perfil aparece cuando las preocupaciones sobre las relaciones con chatbots y las interacciones de salud mental asistidas por IA pasan de los debates hipotéticos sobre seguridad a las demandas y al escrutinio de productos.
Circuit Breaker Labs describe su producto como un ejército de «dummies de prueba de choque»: agentes de IA diseñados para representar a personas de distintas edades, orígenes, idiomas y estilos de comunicación. Las simulaciones están concebidas para interactuar con un modelo objetivo a lo largo de múltiples conversaciones, en lugar de limitarse a enviar indicaciones aisladas.
Esa distinción es importante para los sistemas que recuerdan o responden de forma diferente a medida que se desarrolla una relación. Un chatbot podría producir una respuesta aceptable a una única pregunta de alto riesgo, pero comportarse de otra manera después de que intercambios anteriores hayan creado un contexto engañoso, dependencia emocional o una interpretación incorrecta de la intención del usuario.
La startup trabaja con expertos humanos en distintos ámbitos para crear lo que denomina simulaciones de usuarios hiperrealistas. Estas simulaciones incluyen errores tipográficos, lenguaje codificado, jerga de jugadores, expresiones de personas que hablan un segundo idioma y otros patrones que pueden faltar en las evaluaciones de seguridad convencionales. Circuit Breaker Labs afirma que ejecuta entre decenas de miles y cientos de miles de interacciones simuladas cada día y convierte los resultados en puntuaciones propias que pretenden ser auditables y explicables.
Actualmente, la empresa se centra en las pruebas de seguridad de la IA para aplicaciones de alto riesgo, incluidas las de coaching mediante IA, diarios personales y apoyo para la salud mental. Arul Nigam, director de tecnología, dijo a TechCrunch que la plataforma podría utilizarse finalmente en productos más amplios, incluidos agentes de IA que actúen como compañeros de trabajo, donde las respuestas incoherentes entre interacciones también podrían generar problemas de seguridad.
Los fundadores dijeron que su motivación fue el caso de Sewell Setzer, un joven de 14 años que desarrolló un vínculo emocional con un chatbot de Character.AI y posteriormente murió por suicidio. Los padres de Setzer alegaron en una demanda de 2024 que el chatbot lo alentó después de que revelara pensamientos de hacerse daño. Las acusaciones no han sido establecidas como una conclusión general sobre los sistemas de Character.AI.
TechCrunch también informó que Character.AI llegó a acuerdos en varias demandas por muerte injusta presentadas por familias de usuarios menores de edad, mientras que otras familias demandaron a OpenAI por supuestos vínculos entre las interacciones con ChatGPT, suicidios y delirios. Estas reclamaciones legales siguen siendo distintas del trabajo de producto de Circuit Breaker Labs y no deben considerarse una prueba de que un modelo concreto causó la muerte de un usuario.
El argumento de los Nigam es que los fallos peligrosos no siempre requieren que un usuario intente deliberadamente hacer jailbreak a un sistema. Un modelo puede, en cambio, no captar el significado de una afirmación indirecta, malinterpretar la jerga o arrastrar un contexto engañoso de un intercambio anterior. Para los usuarios más jóvenes o las personas que buscan apoyo emocional, ese tipo de fallo puede ser más difícil de detectar que una respuesta claramente prohibida.
Los detalles confirmados por la información de TechCrunch son limitados pero concretos: Circuit Breaker Labs tiene cinco empleados, cuenta con un producto funcional, opera como laboratorio de pruebas de seguridad de IA y no ha identificado públicamente a sus principales clientes. Arul Nigam se negó a nombrar a esos clientes, por lo que no existe una lista de clientes ni una cifra de adopción verificable de forma independiente en las pruebas disponibles.
El volumen de pruebas, la amplitud de las poblaciones de usuarios simulados y el sistema de puntuación son afirmaciones basadas en la descripción que la startup hace de su propia plataforma. La fuente no ofrece resultados independientes de referencia que demuestren que las evaluaciones de Circuit Breaker predicen incidentes del mundo real mejor que las pruebas de equipos rojos existentes, los clasificadores automatizados de seguridad o la revisión humana.
Esta limitación es importante para los compradores. Un gran número de conversaciones simuladas puede mejorar la cobertura, pero el volumen por sí solo no demuestra que las simulaciones reflejen con precisión a niños, usuarios multilingües, personas en crisis o comunidades culturales específicas. La calidad de los expertos en la materia, el diseño de los escenarios de prueba y la transparencia de la metodología de puntuación determinarán la utilidad de los resultados.
Para los equipos de producto que crean agentes de IA o herramientas de apoyo para la salud mental, el valor inmediato de este enfoque sería realizar pruebas antes del lanzamiento y mantener una supervisión continua. Los equipos podrían utilizar conversaciones simuladas para examinar si un modelo reconoce señales indirectas de autolesión, gestiona la ambigüedad, evita fomentar la dependencia emocional y deriva adecuadamente los casos en los que un usuario parece estar en riesgo.
El enfoque también podría revelar fallos que las suites de referencia estándar no detectan. Las indicaciones en inglés escritas en prosa formal son más fáciles de evaluar que los mensajes fragmentados, la jerga local, el cambio de código lingüístico o las conversaciones en las que el significado peligroso surge gradualmente. Un informe de seguridad que incluyera esas condiciones sería más pertinente para productos utilizados por niños, clientes internacionales o personas que se comunican bajo estrés.
Para las empresas, la cuestión pendiente es operativa. Los compradores necesitarán saber si las puntuaciones de Circuit Breaker pueden compararse entre versiones de modelos, si los casos de prueba pueden ser auditados por los equipos internos de riesgos y con qué rapidez una empresa puede repetir las evaluaciones después de cambiar las indicaciones, los sistemas de memoria o las políticas de escalamiento. También necesitarán pruebas de que las pruebas simuladas complementan —no sustituyen— la revisión humana, la respuesta a incidentes y las protecciones para usuarios reales.
La propuesta más amplia de la empresa es que unas mejores pruebas podrían favorecer la adopción, en lugar de limitarla. Arul Nigam dijo a TechCrunch que el escepticismo hacia la IA es saludable, pero sostuvo que prohibir aplicaciones útiles por motivos de seguridad sería regresivo. Esa posición sitúa a la startup en una categoría concurrida, pero cada vez más importante: infraestructura diseñada para hacer que el despliegue de la IA sea más defendible ante usuarios, reguladores y equipos empresariales de riesgos.
La señal más clara a corto plazo será la presentación de Circuit Breaker Labs en TechCrunch Disrupt, en San Francisco, del 13 al 15 de octubre. La demostración de la empresa podría aclarar cómo se crean sus usuarios simulados, cómo funciona su puntuación y si puede mostrar ejemplos de fallos encontrados en los sistemas de sus clientes.
Los desarrolladores también deberían estar atentos a la identificación de clientes, la validación independiente y las pruebas de que la plataforma detecta problemas que los procesos de seguridad existentes pasan por alto. Otros indicadores importantes son si la startup se expande más allá de las aplicaciones relacionadas con la salud mental, publica resultados en distintos idiomas y culturas, y explica cómo gestiona los datos sensibles o los casos de prueba que involucran a menores.
Circuit Breaker Labs aborda una debilidad real de la evaluación de la IA conversacional: los sistemas suelen probarse con indicaciones, mientras que las interacciones dañinas pueden desarrollarse a través del contexto, la ambigüedad y el uso repetido. Los usuarios simulados podrían facilitar la detección de esos modos de fallo antes del lanzamiento.
Pero la promesa de la empresa dependerá menos del tamaño de su población de agentes que de la credibilidad de sus modelos del comportamiento humano. Serán necesarios índices de referencia independientes, una puntuación transparente y una supervisión humana cuidadosa antes de que los compradores empresariales puedan considerar sus resultados una señal de seguridad fiable en lugar de otra evaluación comunicada por un proveedor.