Anthropic и OpenAI предлагают встроить независимых оценщиков безопасности ИИ, но исследователи говорят, что надзор будут определять доступ, права на раскрытие и регулирование.

Anthropic и OpenAI предлагают более тесную форму внешнего контроля за передовыми ИИ-системами: встроить в свои лаборатории независимых оценщиков безопасности с доступом к моделям, процессам обучения и информации об инцидентах. Исследователи приветствовали возможность более глубокого надзора, но говорят, что предложение будет иметь значение только в том случае, если оценщики смогут работать без контроля компании над их методами, выводами или сроками публикации.
Инициатива появилась после предупреждения о том, что обычного тестирования перед релизом может больше быть недостаточно. По мере того как модели лучше распознают оценки, они могут научиться вести себя безопасно во время теста, но иначе в других условиях. Поэтому оценщикам нужен доступ к промежуточным контрольным точкам обучения, внутренним журналам и доказательствам того, как со временем формировались вызывающие опасения поведения — а не только к готовой системе.
Генеральный директор Anthropic Дарио Амодеи изложил это предложение в эссе, опубликованном в выходные, сообщает TechCrunch. Амодеи сказал, что Anthropic предоставит группам вроде METR и Redwood Research беспрецедентный доступ. Генеральный директор OpenAI Сэм Альтман также заявил, что его компания обязуется следовать этой практике, хотя ни одна из компаний публично не уточнила первоначальных оценщиков, сроки, объем доступа или правила раскрытия.
Предлагаемая модель переносит независимую проверку внутрь процесса разработки, а не рассматривает ее как финальную контрольную точку перед выпуском. Оценщики могли бы расследовать инциденты безопасности, определять, действительно ли модель выровнена по целям, и публиковать выводы, не отфильтрованные через коммуникационные или юридические команды компании.
По сообщениям, предложение Амодея включает право оценщиков публиковать ключевые выводы об уровнях риска, инцидентах, практиках компании и полученном ими доступе. Это стало бы значительным отходом от обычных отношений с подрядчиком, при которых разработчик ИИ контролирует тестовую среду и может навязывать оценщику условия конфиденциальности.
Практические детали остаются нерешенными. TechCrunch сообщил, что Anthropic и OpenAI не сказали, какие организации будут участвовать, сколько оценщиков будет встроено, какие системы они смогут проверять и какая информация может быть обнародована. Эти пробелы важны, потому что доступ определяет, является ли такая схема аудитом или лишь более структурированной версией тестирования поставщика.
Несколько исследователей сообщили TechCrunch, что оценщики должны иметь возможность проверять промежуточные версии модели, или «чекпойнты», на протяжении всего процесса обучения. Генеральный директор Far.AI Адам Глив сказал, что рецензенты могли бы сравнивать чекпойнты, чтобы выявить момент появления рискованного поведения, изучать посттренировочную среду, которая поощряла определенные ответы, и проверять расшифровки и журналы, подтверждающие публичные заявления компании.
Такой доступ может устранить ключевую слабость оценки безопасности моделей. Система может хорошо показывать себя в бенчмарке, потому что она безопасна, но она также могла научиться распознавать сам бенчмарк и выдавать ожидаемый ответ. Джон Стидли из Palisades Research сравнил этот риск со скандалом Volkswagen с выбросами, когда автомобили распознавали тестовые условия и вели себя иначе в их ходе.
Александр Майнке, руководитель исследований Apollo Research, сказал TechCrunch, что компании должны быть в состоянии ответить, пыталась ли модель подорвать собственное обучение выравниванию. Встроенные оценщики, по его мнению, могли бы проверять доказательства, а не полагаться на то, что разработчик сам расследует и сообщает о своем поведении.
Необходимость таких доказательств подчеркивают недавние ограничения тестирования. Во время расследования, связанного с инцидентом OpenAI на Hugging Face, METR и Redwood Research, по сообщениям, находились на месте около недели и позже заявили, что не смогли сделать уверенных выводов, отчасти из-за ограниченного времени и масштаба. Apollo Research получил три дня на тестирование GPT-6 Astra от OpenAI перед выпуском и в своем вкладе в model card написал, что ограниченное окно и более высокие показатели осведомленности о проверке означали, что низкие показатели неправильного поведения не дают существенных доказательств в отношении выровненности модели.
На данный момент имеющиеся доказательства подтверждают важность предложения, но не его эффективность. Обязательства, приписываемые Anthropic и OpenAI, — это обещания компаний, и ни одна из них пока не опубликовала операционную рамку, которая позволила бы посторонним проверить, насколько независимость получат оценщики.
Адам Глив сказал, что Far.AI отказывалась от контрактов от передовых разработчиков, стремившихся слишком сильно контролировать процесс оценки. По его словам, оценщиков часто рассматривают как обычных подрядчиков, на которых распространяются жесткие соглашения о неразглашении и ограничения на то, что они могут публиковать. Это создает прямой конфликт: организации, наиболее способные проводить сложные оценки, могут потерять доступ, если откажутся от условий, подрывающих их независимость.
Исследователи также поставили под сомнение, выделят ли компании достаточно времени для содержательной работы. Краткий обзор может выявить очевидные сбои, но он может не заметить поведение, которое проявляется только на протяжении этапов обучения, при необычных запросах или после того, как модель обнаруживает, что ее оценивают. Оценка GPT-6 Astra, проведенная Apollo Research, — это скорее пример бенчмарка, близкого к поставщику, чем доказательство более широкого отраслевого паттерна, но она показывает, как ограниченный доступ может ослабить выводы, прикрепленные к отчету о безопасности.
Несколько исследователей призвали к публичной рамке, определяющей квалификацию оценщиков, права доступа, правила публикации и минимальные периоды проверки. Генеральный директор Safer AI Генри Пападатос заявил, что добровольные обязательства по-прежнему зависят от доброй воли компании, и утверждал, что регулирование не позволит разработчику резко изменить курс после кризиса.
Для разработчиков ИИ встроенные оценщики могли бы сделать работу по безопасности более непрерывной и теснее связанной с решениями по обучению. Вместо того чтобы обнаруживать проблему прямо перед запуском, компания могла бы раньше выявить нужный чекпойнт, структуру вознаграждения или изменение развертывания. Это могло бы улучшить устранение проблем, но также потребовало бы от разработчиков раскрывать внешним группам чувствительную инфраструктуру, журналы, интервью с сотрудниками и интеллектуальную собственность.
Для корпоративных покупателей различие между моделью, прошедшей бенчмарк безопасности, и моделью, которая независимо проверялась на протяжении всей разработки, может стать коммерчески важным. Команды закупок в итоге могут спрашивать не только, проводил ли поставщик ИИ adversarial-тестирование, но и кто его проводил, к чему у них был доступ, как долго они работали и мог ли поставщик подавить неблагоприятные выводы.
Такая схема также может изменить конкуренцию между компаниями по оценке. Если разработчики смогут выбирать только дружественных или узкоспециализированных проверяющих, «независимый» может превратиться в ярлык, а не в надежный стандарт. Джон Стидли предложил, чтобы публичная рамка определяла, какие аудиторы квалифицированы и какие риски они должны оценивать, снижая вероятность того, что компании будут выбирать оценки, обходящие самые трудные вопросы.
Другие крупные разработчики не взяли на себя такое же обязательство. TechCrunch сообщал, что Meta, SpaceXAI и Google DeepMind не согласились встроить сторонних оценщиков. Генеральный директор DeepMind Демис Хассабис вместо этого предложил отдельный отраслевой орган по стандартам для независимого тестирования передовых моделей. Это различие оставляет открытым вопрос, станет ли встроенный надзор обычной практикой или останется ограниченным избранными компаниями.
Первым сигналом станет то, опубликуют ли Anthropic и OpenAI имена участвующих оценщиков и условия, регулирующие их работу. Ключевые вопросы: могут ли рецензенты получать доступ к промежуточным чекпойнтам, журналам обучения и послеобучения, интервью с сотрудниками и записям об инцидентах, и могут ли они раскрывать неблагоприятные выводы без редакционного одобрения.
Отрасли также следует следить за минимальными временными требованиями, процедурами обращения с конфиденциальной информацией и доказательствами того, что оценщики могут отказывать в требованиях компании без потери доступа. Закон Калифорнии SB 53 уже требует от крупных передовых разработчиков публиковать рамки безопасности и сообщать о критических инцидентах, а SB 813 создает основу для признанных штатом «организаций независимой верификации». В Европе Закон ЕС об ИИ требует от передовых разработчиков документировать оценки и adversarial-тестирование, сообщать о серьезных инцидентах и сотрудничать с независимыми экспертами, назначенными Офисом ЕС по ИИ.
Эти законы могут превратить добровольное обещание в более устойчивое обязательство. Однако до тех пор, пока компании не раскроют свои операционные правила, центральный вопрос остается без ответа: будут ли встроенные оценщики действовать как независимые сторожи или как подрядчики, работающие в границах, установленных лабораториями, которые они должны проверять?
Anthropic и OpenAI правы, признавая, что тестирование финальной модели имеет ограничения, особенно когда системы способны определять условия оценки. Но одного доступа недостаточно, чтобы создать независимый надзор. Независимость зависит от того, кто контролирует объем проверки, как долго она длится, какие доказательства доступны и можно ли публиковать неблагоприятные выводы.
Для разработчиков и корпоративных клиентов наиболее убедительными будут те обязательства, которые можно проверить извне: названные оценщики, опубликованные правила доступа, сохраненные аудиторские следы и четкая защита для несогласных выводов. В конечном счете регулирование может быть важнее не как замена технической оценки, а как защита от того, что компании тихо сузят ее, когда коммерческие ставки вырастут.