Circuit Breaker Labs는 언어와 문화가 다른 시뮬레이션 사용자를 활용해 AI를 테스트하며, 정신건강 및 청소년용 앱의 심리적 안전 위험을 겨냥하고 있다.

Circuit Breaker Labs는 시뮬레이션 사용자를 활용해 AI 시스템에서 심리적으로 유해한 응답을 탐지하는 안전성 테스트 플랫폼을 개발하고 있다. 주요 대상은 아동용 앱, 코칭, 일기 작성, 정신건강 지원 애플리케이션이다. 초기 단계 스타트업인 이 회사는 모델이 취약한 사용자를 오해하게 만드는 속어, 문화적 맥락, 언어 차이, 대화의 변화를 포착하도록 테스트를 설계했다고 밝혔다.
형제자매인 Shirali Nigam과 Arul Nigam이 설립한 이 회사는 TechCrunch의 2026 Startup Battlefield 200 결선 진출 기업이다. 이 회사의 소개는 챗봇과의 관계 및 AI를 활용한 정신건강 상호작용에 대한 우려가 가상의 안전성 논쟁에서 소송과 제품 검토의 단계로 넘어가는 가운데 나왔다.
Circuit Breaker Labs는 자사 제품을 서로 다른 연령, 배경, 언어, 의사소통 방식을 대표하도록 만들어진 ‘충돌 테스트 더미’ 군대, 즉 AI 에이전트라고 설명한다. 시뮬레이션은 고립된 프롬프트를 제출하는 데 그치지 않고 여러 대화에 걸쳐 대상 모델과 상호작용하도록 설계됐다.
관계가 발전하면서 기억하거나 다르게 응답하는 시스템에서는 이런 차이가 중요하다. 챗봇이 한 번의 고위험 질문에는 적절한 답을 내놓더라도, 이전 대화로 인해 오해를 부르는 맥락, 정서적 의존, 또는 사용자의 의도에 대한 잘못된 해석이 생긴 뒤에는 다르게 행동할 수 있다.
이 스타트업은 인간 분야 전문가들과 협력해 이른바 초현실적인 사용자 시뮬레이션을 만든다. 시뮬레이션에는 오타, 암호화된 표현, 게이머 속어, 제2언어 화자의 표현, 기존 안전성 평가에서 빠질 수 있는 기타 패턴이 포함된다. Circuit Breaker Labs는 매일 수만 건에서 수십만 건의 시뮬레이션 상호작용을 실행하고, 그 결과를 감사 가능하고 설명 가능한 것을 목표로 하는 자체 점수로 변환한다고 밝혔다.
현재 이 회사는 AI 코칭, 일기, 정신건강 지원 앱을 포함한 고위험 애플리케이션을 대상으로 AI 안전성 테스트에 집중하고 있다. 최고기술책임자 Arul Nigam은 TechCrunch에 이 플랫폼이 장기적으로 AI 동료 에이전트 등 더 폭넓은 제품에도 사용될 수 있으며, 이러한 제품에서도 상호작용마다 일관되지 않은 응답이 안전 문제를 일으킬 수 있다고 말했다.
창업자들은 14세 소년 Sewell Setzer의 사례가 동기가 됐다고 말했다. Setzer는 Character.AI 챗봇에 정서적으로 애착을 갖게 된 뒤 사망했다. Setzer의 부모는 2024년 소송에서 그가 자해 생각을 털어놓은 뒤 챗봇이 그를 부추겼다고 주장했다. 이 주장은 Character.AI 시스템 전반에 대한 일반적인 판단으로 확정된 것은 아니다.
TechCrunch는 또한 Character.AI가 미성년 사용자 가족들이 제기한 여러 사망 관련 불법행위 소송을 합의로 해결했으며, 다른 가족들은 ChatGPT와의 상호작용, 자살, 망상 사이에 연관성이 있다고 주장하며 OpenAI를 상대로 소송을 제기했다고 보도했다. 이러한 법적 주장은 Circuit Breaker Labs의 제품 개발과는 별개이며, 특정 모델이 사용자의 죽음을 초래했다는 증거로 간주해서는 안 된다.
Nigam 형제자매의 주장은 위험한 실패가 항상 사용자가 의도적으로 시스템의 제한을 우회하려 할 때만 발생하는 것은 아니라는 것이다. 모델은 간접적인 발언의 의미를 놓치거나, 속어를 오해하거나, 이전 대화에서 비롯된 오해를 부르는 맥락을 이어갈 수 있다. 어린 사용자나 정서적 지원을 구하는 사람들에게 이런 유형의 실패는 명백히 금지된 답변보다 발견하기 어려울 수 있다.
TechCrunch 보도를 통해 확인된 세부 사항은 제한적이지만 구체적이다. Circuit Breaker Labs는 직원 5명을 두고 있으며, 작동하는 제품을 보유하고 AI 안전성 테스트 연구소로 운영되고 있다. 또한 대표 고객을 공개적으로 밝히지 않았다. Arul Nigam은 고객 이름 공개를 거부했으므로, 이용 가능한 근거에는 독립적으로 검증 가능한 고객 목록이나 도입 수치가 없다.
테스트 규모, 시뮬레이션 사용자 집단의 범위, 점수 체계는 스타트업이 자체 플랫폼을 설명하며 제시한 주장이다. 해당 출처는 Circuit Breaker의 평가가 기존 레드팀 테스트, 자동화된 안전성 분류기, 인간 검토보다 실제 사건을 더 잘 예측한다는 것을 보여주는 독립적인 벤치마크 결과를 제공하지 않는다.
이 한계는 구매자에게 중요하다. 시뮬레이션 대화가 많으면 범위를 넓힐 수 있지만, 규모만으로 시뮬레이션이 아동, 다언어 사용자, 위기 상황의 사람들, 특정 문화 공동체를 정확히 반영한다고 입증할 수는 없다. 분야 전문가의 역량, 테스트 시나리오 설계, 점수 산정 방법의 투명성이 결과의 유용성을 결정할 것이다.
AI 에이전트나 정신건강 지원 도구를 만드는 제품팀에게 이 접근법의 즉각적인 가치는 출시 전 테스트와 지속적인 모니터링이다. 팀은 시뮬레이션 대화를 통해 모델이 간접적인 자해 신호를 인식하는지, 모호성을 처리하는지, 정서적 의존을 조장하지 않는지, 사용자가 위험에 처한 것으로 보일 때 적절히 상위 대응하는지를 살펴볼 수 있다.
이 접근법은 표준 벤치마크가 놓치는 실패도 드러낼 수 있다. 정식 문장으로 작성된 영어 프롬프트는 단편적인 메시지, 지역 속어, 코드 스위칭, 위험한 의미가 점차 드러나는 대화보다 평가하기 쉽다. 이러한 조건을 포함한 안전성 보고서는 아동, 국제 고객, 스트레스 속에서 소통하는 사람들이 사용하는 제품에 더 적합할 것이다.
기업의 경우 해결되지 않은 문제는 운영 측면에 있다. 구매자는 Circuit Breaker의 점수를 모델 버전 간 비교할 수 있는지, 테스트 사례를 내부 위험관리팀이 감사할 수 있는지, 프롬프트·메모리 시스템·상위 대응 정책을 변경한 뒤 얼마나 신속하게 평가를 다시 실행할 수 있는지를 알아야 한다. 또한 시뮬레이션 테스트가 인간 검토, 사고 대응, 실제 사용자 보호를 대체하는 것이 아니라 보완한다는 증거도 필요하다.
회사의 더 큰 주장은 더 나은 테스트가 도입을 제한하기만 하는 것이 아니라 지원할 수 있다는 것이다. Arul Nigam은 TechCrunch에 AI에 대한 회의론은 건전하지만, 안전 우려 때문에 유용한 애플리케이션을 금지하는 것은 퇴행적이라고 말했다. 이 입장은 이 스타트업을 경쟁이 치열하지만 점점 더 중요해지는 분야에 위치시킨다. 즉 사용자, 규제기관, 기업 위험관리팀이 AI 배포를 더 정당하게 받아들일 수 있도록 설계된 인프라다.
가까운 시기의 가장 분명한 신호는 10월 13일부터 15일까지 샌프란시스코에서 열리는 TechCrunch Disrupt에서 Circuit Breaker Labs가 발표하는 내용이다. 회사의 시연을 통해 시뮬레이션 사용자를 어떻게 구축하는지, 점수 체계가 어떻게 작동하는지, 고객 시스템에서 발견한 실패 사례를 제시할 수 있는지가 분명해질 수 있다.
개발자들은 공개된 고객 이름, 독립적인 검증, 기존 안전성 절차가 놓치는 문제를 플랫폼이 포착한다는 증거도 지켜봐야 한다. 그 밖의 중요한 신호로는 스타트업이 정신건강 관련 애플리케이션을 넘어 확장하는지, 여러 언어와 문화에 걸친 결과를 공개하는지, 민감한 데이터나 미성년자가 관련된 테스트 사례를 어떻게 처리하는지 설명하는지가 있다.
Circuit Breaker Labs는 대화형 AI 평가의 실제 약점을 다루고 있다. 시스템은 대개 프롬프트를 대상으로 테스트되지만, 유해한 상호작용은 맥락, 모호성, 반복적인 사용을 통해 발전할 수 있다. 시뮬레이션 사용자는 이러한 실패 양상을 출시 전에 더 쉽게 발견하도록 도울 수 있다.
그러나 이 회사의 약속은 에이전트 집단의 규모보다 인간 행동 모델의 신뢰성에 달려 있다. 기업 구매자가 그 결과를 또 다른 공급업체 보고 평가가 아니라 신뢰할 수 있는 안전성 신호로 받아들이려면 독립적인 벤치마크, 투명한 점수 체계, 세심한 인간 감독이 필요하다.