AIUC привлекла 40 млн долларов на тестирование и сертификацию корпоративных ИИ-агентов

AIUC привлекла 40 млн долларов для сертификации ИИ-агентов на предмет корпоративной безопасности, используя тысячи тестов для оценки jailbreak-атак, галлюцинаций и утечек данных.

AI News

Artificial Intelligence Underwriting Company (AIUC), стартап, основанный ранним сотрудником Anthropic и бывшим COO организации по безопасности ИИ METR, привлек 40 млн долларов на создание независимого слоя тестирования и сертификации для ИИ-агентов.

Серия A была возглавлена Ribbit Capital при участии First Harmonic, сообщает TechCrunch. Этот раунд доводит общий объем финансирования AIUC до 55 млн долларов, после ранее сообщавшегося посевного раунда на 15 млн долларов при поддержке NFDG Нэта Фридмана, Emergence, Terrain и сооснователя Anthropic Бена Манна.

AIUC нацелен на растущую корпоративную проблему: можно ли доверять ИИ-системе работу внутри бизнес-процессов, а не только то, способна ли она выполнять задачи. Предлагаемый стандарт AIUC-1 частично смоделирован по SOC 2 — широко используемой системе оценки контролей в области безопасности и бизнес-процессов.

Сертификационный слой для ИИ-агентов

AIUC была основана Руном Квистом, ранним сотрудником Anthropic, и Радживом Даттани, который с 2024 по 2025 год занимал должность COO METR и по-прежнему входит в совет организации, сообщает TechCrunch. Основатели позиционируют компанию как независимого оценщика для компаний, которые создают или внедряют ИИ-агентов.

Стартап говорит, что собрал консорциум примерно из 250 руководителей по безопасности и рискам, чтобы определить, что корпоративные покупатели хотят знать перед приобретением агента. По словам Даттани, именно эти обсуждения формируют тесты, которые AIUC использует для оценки систем.

AIUC утверждает, что его сервис тестирования прогоняет агента примерно через 5 000 сценариев, охватывающих такие области, как jailbreak-атаки, галлюцинации и утечка данных. В результате формируется отчет примерно на 100 страниц, в котором указывается, где система ведет себя надежно, а где покупателям следует применять ограничения или дополнительные меры контроля.

Сами тесты проводятся с помощью ИИ-агентов, а ИИ также используется для анализа полученных данных. По словам Квиста, итоговый аудит проверяют люди. Такой человеческий обзор важен, потому что автоматизированный оценщик может унаследовать те же слепые зоны, неверно интерпретировать поведение модели или не распознать тонкую проблему безопасности.

От возможностей модели к операционному риску

Предложение компании отражает изменение того, как бизнес оценивает корпоративный ИИ. Агент, который хорошо показывает себя в бенчмарке, все равно может быть непригоден для рабочих процессов в финансах, здравоохранении, государственном секторе или клиентском сервисе, если он может раскрыть конфиденциальную информацию, следовать вредоносным инструкциям или совершить действие вне своих полномочий.

Квист сказал TechCrunch, что многие организации больше не сдерживаются только потому, что ИИ-моделям не хватает возможностей. Вместо этого им нужны гарантии, что системы будут вести себя в рамках обязательств перед клиентами и регуляторами. Подход AIUC нацелен на предоставление доказательств, которые можно проверить до внедрения, а не только на внутреннее тестирование поставщика.

Компания указывает среди своих клиентов Cursor, Lovable, Harvey и ElevenLabs. Источник не приводит подробностей о масштабе этих отношений, о том, какие продукты были оценены, или о том, завершили ли компании сертификацию AIUC-1. Поэтому эти сигналы внедрения следует рассматривать как заявления самой компании, а не как независимо подтвержденные результаты клиентов.

Бизнес-модель AIUC также отличается от традиционного страхования, несмотря на слово "underwriting" в названии. Имеющиеся сведения описывают сервис тестирования и сертификации, а не покрытие убытков, вызванных ИИ-системой. Немедленный продукт компании — это слой оценки, предназначенный для поддержки решений о закупке и развертывании.

Чем AIUC отличается от оценок в стиле METR

Опыт Даттани в METR дает AIUC связь с уже устоявшейся областью оценки ИИ. METR работала с передовыми лабораториями ИИ, чтобы измерять, могут ли агенты надежно выполнять задачи. Ее исследования также использовались в расследованиях, связанных с поведением моделей, включая работу, связанную с инцидентом OpenAI с Hugging Face.

AIUC утверждает, что его фокус шире и ориентирован на потребности бизнеса. Вместо того чтобы сосредотачиваться в первую очередь на производительности при выполнении задач, процесс AIUC-1 предназначен для изучения сбоев безопасности и надежности, которые могут возникать, когда агенты взаимодействуют с реальными бизнес-данными, инструментами и пользователями.

Это различие важно для покупателей. Система может успешно выполнить задачу в контролируемой оценке, но при этом в продакшене ей могут потребоваться узкие права доступа, мониторинг, одобрение человеком или ограниченная среда работы. Независимое тестирование может помочь закупочным командам сравнивать системы, хотя сертификация не может гарантировать, что агент останется безопасным после обновления модели, смены инструмента или появления новой техники атаки.

Более широкая идея внешней оценки также привлекает внимание компаний, работающих с передовыми моделями. Генеральный директор Anthropic Дарио Амодеи призывал к большей осторожности в развитии фронтирных моделей и предположил, что независимые оценщики могли бы наблюдать и подтверждать работу по безопасности в лабораториях ИИ. AIUC не предлагает размещать оценщиков на площадках клиентов, но основатели преследуют схожий принцип: организации должны иметь доступ к независимым доказательствам до того, как доверять мощным системам.

Что показывают заявления — и что остается недоказанным

Финансирование — это подтвержденное деловое событие, о котором сообщал TechCrunch, как и основатели AIUC, стандарт AIUC-1 и заявленный компанией процесс тестирования. Имена клиентов, размер консорциума, число тестов и объем отчета, о которых сообщается, взяты из собственных раскрытий AIUC в интервью и должны восприниматься как заявления компании.

Пока недостаточно доказательств, чтобы определить, насколько хорошо AIUC-1 предсказывает инциденты в продакшене, насколько стабильно разные оценщики будут выставлять оценки одному и тому же агенту, или будут ли предприятия считать сертификацию обязательным требованием для закупок. Источник также не указывает публичные результаты аудитов, частоту отказов, результаты исправлений, цены или долю тестов, которые проходят агенты.

Эти пробелы существенны. Сертификации безопасности становятся полезными, когда покупатели понимают их охват и когда оценки воспроизводимы со временем. ИИ-агенты могут менять поведение после обновлений модели, интеграции инструментов, изменения промптов или смещения данных, к которым они имеют доступ. Поэтому разовый отчет может быть менее ценным, чем постоянная оценка, связанная с контролями развертывания.

На что смотреть дальше

Первым сигналом станет публикация AIUC деталей завершенных оценок AIUC-1, включая методологию, критерии оценки и примеры сбоев, выявленных во время тестирования. Покупателям также важно знать, как компания работает с обновлениями моделей и нужно ли продлевать сертификацию, если меняются инструменты или права доступа агента.

Еще один важный сигнал — независимая валидация. Данные от корпоративных клиентов, исследователей безопасности или аудиторов, не связанных с AIUC, помогли бы понять, выявляют ли тесты реальные риски, а не только синтетические сбои.

Рынок также покажет, станет ли подход AIUC частью закупочных процедур. Если его примут крупные банки, больницы, государственные учреждения или крупные программные платформы, это будет означать, что сторонняя оценка агентов становится стандартным контролем. И наоборот, если компании будут использовать сертификацию лишь как маркетинговый значок без публикации значимых результатов, ее ценность для разработчиков и покупателей останется ограниченной.

Взгляд Creati.ai

AIUC решает реальное узкое место в корпоративном ИИ: организациям нужен защищаемый способ решать, где агент может действовать автономно, а где ему нужны ограничения. Структурированная внешняя оценка может сделать такие решения более конкретными, чем общие заявления о безопасности модели или общей способности.

Но сертификацию следует рассматривать как доказательство, а не как разрешение снимать защитные меры. Самая сильная версия этого рынка будет сочетать независимые тесты с постоянным мониторингом, доступом по принципу наименьших привилегий, эскалацией к человеку и повторными оценками после существенных изменений системы. Финансирование AIUC дает этой модели пространство для развития; ее доверие будет зависеть от того, сможет ли она показать, что отчеты на практике улучшают решения о внедрении.

Реклама