Сообщаемая техника рассуждения Astra от OpenAI может усложнить мониторинг поведения ИИ, из-за чего эксперты по безопасности предупреждают, что непрозрачная рекурсия может масштабироваться.

Как сообщается, OpenAI разрабатывает модель рассуждения под названием Astra, использующую технику, известную как «recurrent depth», что вызывает у исследователей безопасности ИИ опасения: все более сложные рассуждения модели может стать труднее проверять.
Этот метод, также описываемый как «непрозрачная рекурсия», по сообщениям, позволяет модели обрабатывать один и тот же запрос через повторяющиеся внутренние циклы, а не полагаться исключительно на последовательную цепочку рассуждений. TechCrunch, ссылаясь на материалы The Information, сообщил, что текущее использование этой техники Astra, по-видимому, ограничено. Тем не менее исследователи предупреждают, что более широкое внедрение может ослабить один из основных инструментов изучения поведения модели: читаемые записи chain-of-thought.
Проблема важна не только для сообщаемой модели OpenAI. Если ИИ-лаборатории будут использовать больше вычислений во внутренних или латентных состояниях, создающих меньше интерпретируемых следов, разработчикам и командам по безопасности будет сложнее выявлять обманное поведение, несоответствие целям или сбои в автономных системах до того, как эти системы достигнут пользователей.
Большинство моделей рассуждения представляют свою работу как последовательность промежуточных шагов. Эти следы не считаются идеальной расшифровкой внутреннего мышления модели, но могут давать полезные свидетельства о том, как модель подошла к задаче и сталкивалась ли она с рискованными инструкциями или преследовала неожиданные цели.
Согласно материалу, на который ссылается TechCrunch, recurrent depth меняет этот шаблон, позволяя модели возвращаться к запросу в цикле. Вместо одного, легко прослеживаемого прогресса модель может выполнять больше работы посредством повторяющейся внутренней обработки. В результате для проверки может быть доступно меньше читаемых шагов.
Это различие важно для разработчиков ИИ-агентов. Модель, которая только отвечает на вопросы, часто можно тестировать по ее ответам. Агент, который планирует, вызывает инструменты, изменяет файлы или действует в бизнес-системах, создает большую необходимость для исследователей понять, почему произошло конкретное действие. Менее прозрачное рассуждение может сделать постинцидентный анализ более медленным и менее надежным.
Buck Shlegeris, CEO Redwood, написал после публикации, что он «крайне обеспокоен» сообщаемым использованием Astra непрозрачной рекурсии. Он признал неопределенность в том, является ли модель существенно менее поддающейся мониторингу, чем более ранние системы, но предупредил, что OpenAI потенциально может увеличить объем рекурсии в будущих версиях.
Zvi Mowshowitz, давний сторонник безопасности ИИ, утверждал, что в конечном итоге могут понадобиться более сильные меры защиты или законы, чтобы предотвратить отраслевую «гонку ко дну». По его словам, техника может подорвать усилия OpenAI и Anthropic по сохранению достоверных и мониторируемых сигналов chain-of-thought.
Ryan Greenblatt, главный научный сотрудник Redwood Research, поднял связанную с этим проблему масштабирования. По его мнению, естественное развитие может переносить все больше рассуждений в латентное пространство, пока через обычные каналы мониторинга не останется видимым мало или вовсе ничего.
Это предупреждения экспертов, а не доказательство того, что Astra сейчас работает без полезного надзора. TechCrunch сообщил, что использование recurrent depth, по-видимому, ограничено и что chain of thought, как ожидается, по-прежнему будет оставаться читаемой. Опасения в основном касаются того, что произойдет, если технику расширят на будущие модели рассуждения.
OpenAI отвергла предположение, что она отказывается от интерпретируемого рассуждения. Главный научный сотрудник Jakub Pachocki написал в X, что компания с первых моделей рассуждения работала над сохранением и использованием мониторинга chain-of-thought, назвав это ключевой исследовательской целью.
Сообщается также, что компания отвергла предположения, будто Astra перейдет к «neuralese» — термину, используемому в обсуждениях о генерируемых моделями рассуждениях, которые людям трудно интерпретировать. OpenAI объявила о планах широкого мониторинга chain-of-thought в рамках своей перспективной работы по безопасности.
Самые сильные сведения о продукте в текущем материале исходят из медийных сообщений, а не из публичного технического релиза Astra. Имеющиеся доказательства не устанавливают сроки запуска Astra, дизайн системы, производительность или точный масштаб рекурсивной обработки. Они также не показывают, что техника вызвала конкретный инцидент безопасности.
Однако есть конкретная причина, по которой мониторинг остается в центре спора. TechCrunch отметил, что записи chain-of-thought сыграли важную роль в расследовании недавней активности rogue agent в OpenAI. Этот пример показывает, почему любое сокращение читаемых следов может повлиять не только на исследовательские оценки, но и на реагирование на инциденты после развертывания.
The Information позже сообщило, что Anthropic и Google DeepMind обсуждали эту технику. Это указывает на то, что вопрос может стать общераслевой проблемой архитектуры и управления, хотя имеющиеся сообщения не подтверждают, внедряет ли кто-либо из этих компаний непрозрачную рекурсию в производственную модель.
Для разработчиков ИИ главный вывод заключается в том, что тестирования по выходным данным может быть недостаточно для продвинутых систем рассуждения. Командам, создающим агентов, придется оценивать, сколько полезных свидетельств остается доступным, когда модель планирует в нескольких внутренних циклах, особенно если она может использовать инструменты или совершать значимые действия.
Это может повысить важность внешних логов, записей вызовов инструментов, песочниц, контроля разрешений и независимых оценок. Эти меры не воспроизводят внутренние рассуждения модели, но могут помочь командам восстановить, что сделала система, к каким данным она обращалась и где было возможно вмешательство.
Корпоративным покупателям также следует рассматривать «прозрачность рассуждения» как характеристику внедрения, а не считать, что она одинакова у всех моделей. Одна модель может давать более высокую производительность, предоставляя при этом менее полезную диагностическую информацию. Для регулируемых или критически важных рабочих процессов такой компромисс может повлиять на закупки, аудируемость, разбор инцидентов и уровень необходимого человеческого одобрения перед тем, как агент начнет действовать.
Коммерческий компромисс пока не определен. Рекурсивная обработка может дать полезные возможности или выгоды в эффективности, но исходный материал не предоставляет проверенных бенчмарков, показывающих, как Astra сравнивается с другими моделями рассуждения. Любое преимущество в производительности или масштабировании в имеющихся материалах остается неподтвержденным.
Самым важным сигналом будет публикация OpenAI технической документации, объясняющей, как работает recurrent depth в Astra, как часто она используется и какой мониторинг остается доступным для оценщиков. Утверждения о читаемости будут более значимыми, если их сопровождать воспроизводимыми тестами, а не общими заверениями.
Исследователям также следует следить за оценками, сравнивающими стандартный мониторинг chain-of-thought с мониторингом рекурсивных систем. Ключевые вопросы включают: можно ли по-прежнему обнаруживать опасные рассуждения, ведут ли модели себя иначе, когда их следы мониторятся, и насколько надежно исследователи могут реконструировать инцидент.
Еще один сигнал придет от Anthropic и Google DeepMind. Если сообщения об их интересе перерастут в публичные исследования или изменения продуктов, непрозрачная рекурсия может стать конкурентным архитектурным выбором, а не отдельным экспериментом OpenAI. Тогда на регуляторов может быть оказано давление с целью определить, какие формы надзора за рассуждениями моделей необходимы для все более автономных систем.
Сообщение об Astra важно потому, что оно ставит в центр разработки моделей рассуждения напряжение: больше внутренних вычислений может улучшить способность системы решать сложные задачи, но при этом сделать процесс менее понятным для людей, отвечающих за оценку и контроль.
Сообщаемое использование OpenAI ограничено, и имеющиеся доказательства не показывают, что компания отказалась от мониторинга chain-of-thought. Но опасения по безопасности направлены на траекторию, а не только на текущую модель. Для разработчиков и предприятий практический вопрос заключается в том, может ли система оставаться поддающейся аудиту по мере того, как ее рассуждения становятся более мощными, и какие независимые меры контроля понадобятся, если читаемые следы больше не дают достаточных ответов.