Circuit Breaker Labs 正在利用不同語言與文化背景的模擬使用者測試 AI,鎖定心理健康與青少年應用程式中的心理安全風險。

Circuit Breaker Labs 正在開發一個安全測試平台,利用模擬使用者探測 AI 系統是否會產生心理上有害的回應,尤其針對兒童、教練、日記與心理健康支援應用程式。這家早期新創公司表示,其測試設計旨在捕捉俚語、文化脈絡、語言差異與對話偏移,這些因素都可能導致模型誤解脆弱使用者。
這家公司由兄妹 Shirali 和 Arul Nigam 創立,是 TechCrunch 2026 Startup Battlefield 200 的決賽入圍者之一。其受到關注之際,外界對聊天機器人關係以及 AI 輔助心理健康互動的擔憂,正從假設性的安全辯論轉向訴訟與產品審查。
Circuit Breaker Labs 將其產品描述為一支「碰撞測試假人」大軍:由不同年齡、背景、語言與溝通方式的人所代表的 AI 代理。這些模擬旨在與目標模型進行多次對話,而不只是提交彼此孤立的提示。
對於會記憶內容,或會隨著關係發展而作出不同回應的系統而言,這項差異十分重要。聊天機器人可能對單一高風險問題給出可接受的答案,但在先前的互動形成誤導性脈絡、情感依賴或對使用者意圖的錯誤解讀後,行為可能有所不同。
這家新創公司與人類領域專家合作,建立其所稱的超寫實使用者模擬。這些模擬包含錯字、編碼語言、玩家俚語、第二語言表達方式,以及傳統安全評估可能缺少的其他模式。Circuit Breaker Labs 表示,該公司每天執行數萬至數十萬次模擬互動,並將結果轉化為旨在可稽核且可解釋的專有分數。
目前,公司專注於針對高風險應用程式的 AI 安全測試,包括 AI 教練、日記與心理健康支援應用程式。技術長 Arul Nigam 告訴 TechCrunch,這個平台最終可能用於更廣泛的產品,包括 AI 同事代理;在這類產品中,不同互動之間不一致的回應同樣可能造成安全問題。
創辦人表示,他們的動機來自 Sewell Setzer 的案例。這名 14 歲少年對Character.AI聊天機器人產生情感依附,之後自殺身亡。Setzer 的父母在 2024 年提起的訴訟中指稱,聊天機器人在他透露有傷害自己的想法後鼓勵了他。這些指控尚未被確立為對 Character.AI 系統的一般性結論。
TechCrunch 也報導,Character.AI 已與未成年使用者家屬提出的多起不當死亡訴訟達成和解;另外一些家庭則以 ChatGPT 互動、自殺與妄想之間存在所謂關聯為由,起訴OpenAI。這些法律主張與 Circuit Breaker Labs 的產品工作是不同的,不應被視為任何特定模型造成使用者死亡的證據。
Nigam 兄妹的論點是,危險的失敗不一定需要使用者刻意越獄突破系統。模型可能無法理解間接陳述的含義、誤解俚語,或承接先前互動中的誤導性脈絡。對年輕使用者或尋求情感支援的人而言,這類失敗可能比明確禁止的回答更難被發現。
TechCrunch 報導所確認的細節有限但具體:Circuit Breaker Labs 有五名員工,擁有可運作的產品,正以 AI 安全測試實驗室的形式運作,且尚未公開其主要客戶。Arul Nigam 拒絕透露這些客戶的姓名,因此現有證據中沒有可獨立驗證的客戶名單或採用數據。
測試量、模擬使用者群體的廣度,以及評分系統,都是根據新創公司對自家平台的描述所報導的主張。來源並未提供獨立基準測試結果,證明 Circuit Breaker 的評估比現有的紅隊測試、自動化安全分類器或人工審查更能預測真實世界事件。
這項限制對買方十分重要。大量模擬對話可以改善涵蓋範圍,但數量本身並不能證明模擬準確反映兒童、多語言使用者、身處危機的人,或特定文化社群。領域專家的品質、測試情境的設計,以及評分方法的透明度,將決定結果的實用性。
對於打造 AI 代理或心理健康支援工具的產品團隊而言,這種方法的直接價值在於上市前測試與持續監控。團隊可以利用模擬對話,檢查模型是否能辨識間接的自我傷害訊號、處理模糊性、避免鼓勵情感依賴,以及在使用者看似處於風險中時適當升級處理。
這種方法也可能揭露標準基準測試套件漏掉的失敗。用正式散文撰寫的英語提示,比片段式訊息、地方俚語、語碼轉換,或危險含義逐漸浮現的對話更容易評估。包含這些條件的安全報告,對兒童、國際客戶或在壓力下溝通的人所使用的產品而言會更具相關性。
對企業而言,尚未解決的問題在於營運。買方需要知道 Circuit Breaker 的分數能否在不同模型版本之間比較,測試案例能否由內部風險團隊稽核,以及在更改提示、記憶系統或升級處理政策後,公司能多快重新執行評估。他們也需要證據證明模擬測試是補充,而不是取代人工審查、事件回應與對真實使用者的保護。
公司的更廣泛主張是,更好的測試可以支持採用,而不只是限制採用。Arul Nigam 告訴 TechCrunch,對 AI 持懷疑態度是健康的,但他認為僅因安全疑慮就禁止有用的應用程式將會是一種倒退。這使該新創公司處於一個競爭激烈但日益重要的類別:旨在讓 AI 部署更能向使用者、監管機構與企業風險團隊提出充分理由的基礎設施。
近期最明確的訊號將是 Circuit Breaker Labs 於 10 月 13 日至 15 日在舊金山舉行的 TechCrunch Disrupt 上進行展示。公司的示範可能會說明其如何建立模擬使用者、評分如何運作,以及能否展示在客戶系統中發現的失敗案例。
開發者也應留意具名客戶、獨立驗證,以及平台能找出現有安全流程漏掉的問題之證據。其他重要訊號包括:這家新創公司是否擴展到心理健康相關應用程式以外、是否公布跨語言與文化的結果,以及是否解釋如何處理敏感資料或涉及未成年人的測試案例。
Circuit Breaker Labs 正在處理對話式 AI 評估中的一項真實弱點:系統通常以提示進行測試,但有害互動可能透過脈絡、模糊性與重複使用逐步形成。模擬使用者可能讓這些失敗模式更容易在產品發布前被找出。
但公司的承諾能否實現,較少取決於其代理人群的規模,更多取決於其人類行為模型的可信度。在企業買方能將其結果視為可靠的安全訊號,而不是另一項由供應商報告的評估之前,仍需要獨立基準測試、透明評分與謹慎的人類監督。