Исследование KAIST и Naver AI Lab показывает, что модели внутренне кодируют различные операции рассуждения, открывая новые возможности и ограничения для надзора за ИИ.

Исследование, проведённое учёными из южнокорейского KAIST и Naver AI Lab, показало, что несколько операций рассуждения, видимых в письменном решении ИИ-модели, также проявляются как разделимые паттерны в её внутренних представлениях. Сигнал был самым сильным в средних слоях протестированных моделей, что позволяет предположить: внутренняя активность может раскрывать больше о вычислениях модели, чем один лишь итоговый текст.
Это открытие важно, поскольку разработчики всё чаще используют письменные рассуждения как несовершенное окно в то, как модели решают задачи. Если внутренние состояния различают такие действия, как извлечение формулы, разбиение задачи на части или выполнение вычисления, исследователи в будущем смогут напрямую наблюдать за этими процессами или вмешиваться в них. Однако исследование пока не показывает, что эти паттерны надёжно выявляют ошибки или управляют генерацией в реальном времени.
Команда изучала три модели — Qwen2.5-7B, Qwen3-8B и Gemma4-31B — в процессе решения математических задач. Исследователи разбили сгенерированные решения на сегменты и классифицировали каждый сегмент по одной из восьми повторяющихся операций. Категории включали извлечение информации, разбиение задачи на части, воспроизведение формулы, дедукцию и вычисление.
Согласно пересказу исследования The Decoder, метки классификации были получены с помощью GPT-5. Затем исследователи проверили, содержит ли внутреннее числовое представление моделей достаточно информации, чтобы различать эти операции.
Во всех трёх моделях классификаторы смогли разделить категории рассуждений по внутренним представлениям. Различие было наиболее выражено в средних слоях, а не в начале или в конце сетей. Этот паттерн говорит о том, что модели могут сначала обрабатывать язык в относительно смешанном виде, а затем организовывать его в более специфичные для операций внутренние состояния.
Исследователи также обнаружили, что обычные слова могут принимать разные внутренние представления в зависимости от окружающей рассуждающей активности. Такие слова, как «a», «is» и «the», встречались во многих категориях на поверхностном уровне, но их внутренние состояния разделялись в соответствии с текущей операцией.
Этот результат важен, потому что он противоречит простому объяснению, основанному только на словаре. Классификатор, использующий сами токены, работал хуже, чем тот, что использовал внутренние представления. Положение сегмента в решении также не объясняло разделение.
В исследование вошло несколько тестов, призванных показать, что сигнал отражает нечто большее, чем поверхностные текстовые паттерны. В одном вмешательстве исследователи заблокировали внимание к предыдущим 30 токенам. Представление, связанное с текущей операцией, ослабло, что указывает на зависимость шага рассуждения от предыдущего контекста, а не на его независимое формирование.
Категории операций оставались распознаваемыми даже тогда, когда модель приходила к неверному ответу. Ошибочное вычисление всё равно выглядело внутренне как вычисление, а извлечение формулы и дедукция сохраняли свои характерные сигнатуры. В будущем это различие может помочь исследователям отделять тип процесса, который модель пытается выполнить, от того, привёл ли этот процесс к правильному результату.
Заявленный эффект был воспроизведён на Llama-3-8B. Для Qwen3-8B классификаторы, обученные на одном наборе задач, перенеслись на GPQA-Diamond и MATH-500, согласно The Decoder. Эти дополнительные тесты указывают на то, что представления могут обобщаться за пределы исходных примеров, но не доказывают широкую надёжность между моделями или доменами.
Доказательства остаются узкими. Эксперименты были сосредоточены на математических задачах и небольшой группе языковых моделей. Из доступного описания недостаточно деталей, чтобы оценить полный набор данных, дизайн классификатора, статистические погрешности или то, была ли работа независимо воспроизведена. Перенос на другие домены, более длинные цепочки рассуждений, мультимодальные системы и модели промышленного масштаба в имеющихся данных не проверялся.
Ключевой вывод состоит в том, что видимая цепочка рассуждений модели может отражать лишь часть её внутреннего вычисления. The Decoder ссылается на более раннюю работу Anthropic, согласно которой модели раскрывали подсказки, использованные в их рассуждениях, лишь в 25–39% случаев. Также приводится исследование, предполагающее, что Claude Opus 4.6 обрабатывает информацию, которая не появляется в его выходных рассуждениях.
Это ограничение усложняет системы надзора, построенные вокруг чтения сгенерированных объяснений. Модель может выдавать правдоподобное объяснение, опираясь на внутренние шаги, отсутствующие в тексте, или описывать операцию рассуждения, не выполняя её корректно. Результат KAIST и Naver AI Lab не решает эту проблему, но даёт основания считать, что внутренние представления содержат структурированную информацию о типе текущего рассуждения.
Для исследователей моделей следующая возможность — обучать зонды, которые выявляют операции в процессе генерации. Такие инструменты могли бы, например, отмечать неожиданные вычисления, обнаруживать переход от дедукции к необоснованному угадыванию или помогать выяснять, почему решение не удалось. Для продуктовых команд, однако, это пока направления исследований, а не готовые к развёртыванию меры защиты.
Это открытие может стать ещё более значимым по мере того, как всё больше систем переводят рассуждение в скрытые числовые состояния. The Decoder связывает эту работу с OpenAI Astra и техникой Recurrent Depth, которая переносит часть процесса рассуждения из обычного видимого текста. Если модели всё чаще выполняют вычисления внутри, методы анализа представлений могут оказаться важнее, чем методы, анализирующие только сгенерированные объяснения.
Самый важный следующий вопрос — сохраняются ли сигнатуры операций вне математики. Тесты на программирование, научный анализ, планирование и использование инструментов покажут, описывают ли паттерны общие функции рассуждения или в основном отражают структуру математических решений.
Исследователям также предстоит определить, могут ли внутренние сигналы выявлять ошибки до завершения ответа моделью. Текущий результат показывает, что ошибочное вычисление всё ещё можно распознать как вычисление; он не показывает, что монитор способен понять, когда вычисление пошло не так.
Ещё один открытый вопрос — вмешательство. Исследование показало, что удаление предыдущего контекста ослабляет сигнал, но не показало, что усиление или модификация представления может надёжно направить модель к нужной операции. Воспроизводимость на более крупных и более разнообразных моделях станет ещё одним ключевым тестом.
Корпоративным покупателям ИИ следует внимательно относиться к инструментам мониторинга, делающим заявления о скрытом рассуждении. Пока эти методы не будут проверены на разных задачах и оценены на предмет устойчивости к враждебному поведению, анализ внутреннего состояния должен дополнять — а не заменять — тестирование выходов, проверку результатов инструментов и традиционные меры безопасности.
Это исследование усиливает осторожный взгляд на мониторинг цепочки рассуждений: письменные рассуждения — полезное доказательство, но не полный протокол вычислений модели. Внутренние паттерны, выявленные исследователями, показывают, что модели кодируют различия между видами рассуждений, однако разрыв между распознаванием процесса и его оценкой или контролем остаётся значительным.
Для разработчиков практический вывод состоит в том, чтобы рассматривать зонды интерпретируемости как формирующийся диагностический слой. В будущем они могут помочь в отладке моделей и оценке безопасности, особенно в системах, которые скрывают большую часть своих рассуждений. На данный момент самый сильный вывод, подтверждённый данными, уже: внутренние представления содержат структурированные сигналы о том, какой именно шаг рассуждения, по-видимому, выполняет модель, даже если ответ неверен.