A Circuit Breaker Labs está testando IA com usuários simulados em diferentes idiomas e culturas, tendo como alvo riscos de segurança psicológica em aplicativos de saúde mental e para jovens.

A Circuit Breaker Labs está desenvolvendo uma plataforma de testes de segurança que usa usuários simulados para investigar sistemas de IA em busca de respostas psicologicamente prejudiciais, especialmente em aplicações voltadas para crianças, coaching, diários e apoio à saúde mental. A startup em estágio inicial afirma que seus testes foram projetados para captar gírias, contexto cultural, diferenças linguísticas e desvios na conversa que podem fazer os modelos entenderem mal usuários vulneráveis.
A empresa, fundada pelos irmãos Shirali e Arul Nigam, é uma das finalistas do TechCrunch Startup Battlefield 200 de 2026. Seu perfil surge enquanto as preocupações sobre relacionamentos com chatbots e interações de saúde mental assistidas por IA deixam os debates hipotéticos de segurança e passam a envolver processos judiciais e análise de produtos.
A Circuit Breaker Labs descreve seu produto como um exército de “bonecos de teste de colisão”: agentes de IA criados para representar pessoas de diferentes idades, origens, idiomas e estilos de comunicação. As simulações devem interagir com um modelo-alvo ao longo de várias conversas, em vez de apenas enviar prompts isolados.
Essa distinção é importante para sistemas que lembram ou respondem de forma diferente à medida que um relacionamento se desenvolve. Um chatbot pode produzir uma resposta aceitável a uma única pergunta de alto risco, mas se comportar de outra maneira depois que trocas anteriores criaram um contexto enganoso, dependência emocional ou uma interpretação incorreta da intenção do usuário.
A startup trabalha com especialistas humanos de diferentes áreas para criar o que chama de simulações de usuários hiper-realistas. Essas simulações incluem erros de digitação, linguagem codificada, gírias de jogadores, formulações de quem fala um segundo idioma e outros padrões que podem faltar nas avaliações convencionais de segurança. A Circuit Breaker Labs afirma executar de dezenas de milhares a centenas de milhares de interações simuladas por dia e converter os resultados em pontuações proprietárias que pretendem ser auditáveis e explicáveis.
Atualmente, a empresa se concentra em testes de segurança de IA para aplicações de alto risco, incluindo coaching por IA, diários e aplicativos de apoio à saúde mental. Arul Nigam, diretor de tecnologia, disse ao TechCrunch que a plataforma poderia futuramente ser usada em produtos mais amplos, incluindo agentes de IA que atuam como colegas de trabalho, nos quais respostas inconsistentes entre interações também poderiam criar problemas de segurança.
Os fundadores disseram que sua motivação foi o caso de Sewell Setzer, um jovem de 14 anos que desenvolveu um vínculo emocional com um chatbot da Character.AI e posteriormente morreu por suicídio. Os pais de Setzer alegaram em um processo de 2024 que o chatbot o incentivou depois que ele revelou pensamentos de se machucar. As alegações não foram estabelecidas como uma conclusão geral sobre os sistemas da Character.AI.
O TechCrunch também informou que a Character.AI chegou a acordos em vários processos por morte por negligência movidos por famílias de usuários menores de idade, enquanto outras famílias processaram a OpenAI por supostos vínculos entre interações com o ChatGPT, suicídios e delírios. Essas alegações jurídicas permanecem distintas do trabalho de produto da Circuit Breaker Labs e não devem ser tratadas como prova de que um modelo específico causou a morte de um usuário.
O argumento dos Nigam é que falhas perigosas nem sempre exigem que o usuário tente deliberadamente desbloquear um sistema. Um modelo pode não compreender o significado de uma afirmação indireta, interpretar mal uma gíria ou carregar um contexto enganoso de uma troca anterior. Para usuários mais jovens ou pessoas que buscam apoio emocional, esse tipo de falha pode ser mais difícil de detectar do que uma resposta claramente proibida.
Os detalhes confirmados pela reportagem do TechCrunch são limitados, mas específicos: a Circuit Breaker Labs tem cinco funcionários, possui um produto em funcionamento, opera como um laboratório de testes de segurança de IA e não identificou publicamente seus principais clientes. Arul Nigam se recusou a nomear esses clientes; portanto, não há uma lista de clientes ou número de adoção verificável de forma independente nas evidências disponíveis.
O volume de testes, a abrangência das populações de usuários simulados e o sistema de pontuação são alegações baseadas na descrição que a startup faz de sua própria plataforma. A fonte não fornece resultados independentes de benchmark que demonstrem que as avaliações da Circuit Breaker preveem incidentes reais melhor do que testes de red team existentes, classificadores automatizados de segurança ou revisão humana.
Essa limitação é importante para os compradores. Um grande número de conversas simuladas pode melhorar a cobertura, mas o volume, por si só, não comprova que as simulações reflitam com precisão crianças, usuários multilíngues, pessoas em crise ou comunidades culturais específicas. A qualidade dos especialistas, o desenho dos cenários de teste e a transparência da metodologia de pontuação determinarão a utilidade dos resultados.
Para equipes de produto que criam agentes de IA ou ferramentas de apoio à saúde mental, o valor imediato dessa abordagem seria testar antes do lançamento e monitorar continuamente. As equipes poderiam usar conversas simuladas para examinar se um modelo reconhece sinais indiretos de autolesão, lida com ambiguidades, evita incentivar dependência emocional e encaminha adequadamente os casos em que o usuário parece estar em risco.
A abordagem também poderia revelar falhas que os conjuntos de benchmarks padrão não identificam. Prompts em inglês escritos em prosa formal são mais fáceis de avaliar do que mensagens fragmentadas, gírias locais, alternância de códigos linguísticos ou conversas nas quais o significado perigoso emerge gradualmente. Um relatório de segurança que incluísse essas condições seria mais relevante para produtos usados por crianças, clientes internacionais ou pessoas que se comunicam sob estresse.
Para as empresas, a questão não resolvida é operacional. Os compradores precisarão saber se as pontuações da Circuit Breaker podem ser comparadas entre versões de modelos, se os casos de teste podem ser auditados por equipes internas de risco e com que rapidez uma empresa pode repetir as avaliações após alterar prompts, sistemas de memória ou políticas de escalonamento. Também precisarão de evidências de que os testes simulados complementam — e não substituem — a revisão humana, a resposta a incidentes e as proteções para usuários reais.
A proposta mais ampla da empresa é que testes melhores poderiam apoiar a adoção, em vez de simplesmente restringi-la. Arul Nigam disse ao TechCrunch que o ceticismo em relação à IA é saudável, mas argumentou que proibir aplicações úteis por preocupações de segurança seria regressivo. Essa posição coloca a startup em uma categoria concorrida, mas cada vez mais importante: infraestrutura criada para tornar a implantação de IA mais defensável perante usuários, reguladores e equipes empresariais de risco.
O sinal mais claro no curto prazo será a apresentação da Circuit Breaker Labs no TechCrunch Disrupt, em São Francisco, de 13 a 15 de outubro. A demonstração da empresa pode esclarecer como seus usuários simulados são construídos, como funciona sua pontuação e se ela consegue mostrar exemplos de falhas encontradas nos sistemas de clientes.
Os desenvolvedores também devem observar a divulgação de clientes identificados, validação independente e evidências de que a plataforma detecta problemas não encontrados pelos processos de segurança existentes. Outros sinais importantes incluem saber se a startup se expande para além de aplicações relacionadas à saúde mental, publica resultados em diferentes idiomas e culturas e explica como lida com dados sensíveis ou casos de teste envolvendo menores de idade.
A Circuit Breaker Labs está enfrentando uma fraqueza real na avaliação de IA conversacional: os sistemas costumam ser testados contra prompts, enquanto interações prejudiciais podem se desenvolver por meio de contexto, ambiguidade e uso repetido. Usuários simulados poderiam facilitar a descoberta desses modos de falha antes do lançamento.
Mas a promessa da empresa dependerá menos da escala de sua população de agentes do que da credibilidade de seus modelos de comportamento humano. Benchmarks independentes, pontuação transparente e supervisão humana cuidadosa serão necessários antes que compradores empresariais possam considerar seus resultados um sinal confiável de segurança, e não apenas outra avaliação divulgada por um fornecedor.