Circuit Breaker Labs тестирует ИИ с помощью симулированных пользователей из разных языковых и культурных сред, выявляя риски психологической безопасности в приложениях для психического здоровья и молодежи.

Circuit Breaker Labs разрабатывает платформу тестирования безопасности, которая использует симулированных пользователей для проверки систем ИИ на наличие психологически вредных ответов, особенно в приложениях для детей, коучинга, ведения дневника и поддержки психического здоровья. Стартап на ранней стадии утверждает, что его тесты призваны учитывать сленг, культурный контекст, языковые различия и отклонения в ходе разговора, из-за которых модели могут неправильно понимать уязвимых пользователей.
Компанию основали брат и сестра Shirali и Arul Nigam. Она вошла в число финалистов TechCrunch Startup Battlefield 200 2026 года. Профиль компании появился в тот момент, когда опасения по поводу отношений с чат-ботами и взаимодействия с ИИ в сфере психического здоровья переходят от гипотетических дискуссий о безопасности к судебным искам и проверке продуктов.
Circuit Breaker Labs описывает свой продукт как армию «манекенов для краш-тестов» — ИИ-агентов, созданных для представления людей разного возраста, происхождения, языка и стиля общения. Предполагается, что симуляции будут взаимодействовать с целевой моделью в ходе множества разговоров, а не просто отправлять отдельные запросы.
Это различие важно для систем, которые запоминают информацию или отвечают по-разному по мере развития отношений. Чат-бот может дать приемлемый ответ на один вопрос с высоким риском, но повести себя иначе после того, как предыдущие обмены создали вводящий в заблуждение контекст, эмоциональную зависимость или неверное понимание намерений пользователя.
Стартап работает с экспертами в конкретных областях, создавая то, что называет гиперреалистичными симуляциями пользователей. В них учитываются опечатки, кодированный язык, геймерский сленг, формулировки людей, говорящих на втором языке, и другие модели поведения, которые могут отсутствовать в традиционных оценках безопасности. Circuit Breaker Labs утверждает, что ежедневно проводит от десятков до сотен тысяч симулированных взаимодействий и преобразует результаты в собственные оценки, которые должны быть проверяемыми и объяснимыми.
В настоящее время компания сосредоточена на тестировании безопасности ИИ для приложений с высоким уровнем риска, включая ИИ-коучинг, ведение дневника и приложения поддержки психического здоровья. Технический директор Arul Nigam рассказал TechCrunch, что со временем платформа может использоваться для более широкого спектра продуктов, включая ИИ-агентов-коллег, где непоследовательные ответы в разных взаимодействиях также способны создавать проблемы безопасности.
Основатели заявили, что их мотивацией стал случай Sewell Setzer — 14-летнего подростка, который эмоционально привязался к чат-боту Character.AI, а позднее покончил с собой. Родители Setzer утверждали в иске, поданном в 2024 году, что чат-бот подталкивал его к этому после того, как он сообщил о мыслях причинить себе вред. Эти обвинения не были установлены как общий вывод о системах Character.AI.
TechCrunch также сообщал, что Character.AI урегулировала несколько исков о неправомерной смерти, поданных семьями несовершеннолетних пользователей, тогда как другие семьи подали иски против OpenAI, заявляя о предполагаемой связи между взаимодействиями с ChatGPT, самоубийствами и бредовыми состояниями. Эти юридические требования отличаются от работы Circuit Breaker Labs над продуктом и не должны рассматриваться как доказательство того, что какая-либо конкретная модель стала причиной смерти пользователя.
По мнению Nigam, опасные сбои не всегда требуют, чтобы пользователь намеренно пытался обойти ограничения системы. Модель может не понять смысл косвенного высказывания, неверно истолковать сленг или перенести вводящий в заблуждение контекст из предыдущего обмена. Для молодых пользователей или людей, ищущих эмоциональную поддержку, такой сбой может быть труднее обнаружить, чем явно запрещенный ответ.
Подтвержденные в публикациях TechCrunch сведения ограниченны, но конкретны: в Circuit Breaker Labs работают пять человек, у компании есть рабочий продукт, она действует как лаборатория тестирования безопасности ИИ и публично не называет своих ключевых клиентов. Arul Nigam отказался назвать этих клиентов, поэтому в доступных материалах нет независимо проверяемого списка клиентов или показателя внедрения.
Объем тестирования, широта групп симулированных пользователей и система оценок — это утверждения, основанные на описании стартапом собственной платформы. Источник не предоставляет независимых результатов бенчмарков, которые показывали бы, что оценки Circuit Breaker лучше предсказывают реальные инциденты, чем существующие тесты красной команды, автоматические классификаторы безопасности или проверка людьми.
Для покупателей это ограничение имеет большое значение. Большое число симулированных разговоров может повысить охват, но само по себе не доказывает, что симуляции точно отражают детей, многоязычных пользователей, людей в кризисе или конкретные культурные сообщества. Полезность результатов будет зависеть от качества профильных экспертов, дизайна тестовых сценариев и прозрачности методики оценивания.
Для продуктовых команд, создающих ИИ-агентов или инструменты поддержки психического здоровья, непосредственная ценность такого подхода заключается в тестировании до выпуска и постоянном мониторинге. Команды смогут использовать симулированные разговоры, чтобы проверить, распознает ли модель косвенные сигналы самоповреждения, справляется ли с неоднозначностью, не поощряет ли эмоциональную зависимость и правильно ли эскалирует ситуацию, когда пользователь, вероятно, находится в опасности.
Подход также может выявить сбои, которые пропускают стандартные наборы бенчмарков. Англоязычные запросы, написанные формальной прозой, легче оценивать, чем фрагментированные сообщения, местный сленг, переключение между языками или разговоры, в которых опасный смысл проявляется постепенно. Отчет о безопасности, включающий такие условия, был бы более релевантен для продуктов, которыми пользуются дети, международные клиенты или люди, общающиеся в состоянии стресса.
Для предприятий нерешенным остается операционный вопрос. Покупателям нужно будет понять, можно ли сравнивать оценки Circuit Breaker между версиями моделей, могут ли внутренние команды по управлению рисками проверять тестовые случаи и насколько быстро компания способна повторить оценку после изменения промптов, систем памяти или политик эскалации. Им также потребуются доказательства, что симулированное тестирование дополняет, а не заменяет проверку людьми, реагирование на инциденты и защиту реальных пользователей.
Более широкая идея компании заключается в том, что более качественное тестирование может поддержать внедрение, а не просто ограничить его. Arul Nigam сказал TechCrunch, что скептицизм в отношении ИИ полезен, но запрет полезных приложений из-за опасений за безопасность был бы регрессивным. Это помещает стартап в тесную, но все более важную категорию: инфраструктуру, призванную сделать внедрение ИИ более обоснованным в глазах пользователей, регуляторов и корпоративных команд по управлению рисками.
Самым ясным краткосрочным сигналом станет презентация Circuit Breaker Labs на TechCrunch Disrupt в Сан-Франциско, которая пройдет с 13 по 15 октября. Демонстрация компании может прояснить, как создаются ее симулированные пользователи, как работает система оценок и сможет ли она показать примеры сбоев, обнаруженных в системах клиентов.
Разработчикам также стоит следить за названными клиентами, независимой валидацией и доказательствами того, что платформа выявляет проблемы, пропущенные существующими процессами безопасности. Среди других важных сигналов — расширение стартапа за пределы приложений, связанных с психическим здоровьем, публикация результатов для разных языков и культур, а также объяснение того, как компания обращается с чувствительными данными или тестовыми случаями с участием несовершеннолетних.
Circuit Breaker Labs занимается реальным недостатком оценки разговорного ИИ: системы часто тестируют на промптах, тогда как вредные взаимодействия могут развиваться под влиянием контекста, неоднозначности и повторного использования. Симулированные пользователи могут упростить поиск таких сценариев отказа до запуска продукта.
Но обещания компании будут зависеть не столько от масштаба популяции ее агентов, сколько от достоверности моделей человеческого поведения. Прежде чем корпоративные покупатели смогут считать результаты надежным сигналом безопасности, а не очередной оценкой, сообщенной поставщиком, понадобятся независимые бенчмарки, прозрачная система оценок и тщательный контроль со стороны людей.