KAISTとNaver AI Labの研究により、モデルは異なる推論操作を内部で符号化していることが示され、AI監督の新たな可能性と限界が浮かび上がった。

韓国のKAISTとNaver AI Labの研究者による研究は、AIモデルの書かれた解答に見える複数の推論操作が、その内部表現の中でも分離可能なパターンとして現れることを示した。信号は、テストしたモデルの中間層で最も強く、内部活動が最終的なテキストだけよりもモデルの計算内容を多く明らかにする可能性を示唆している。
この発見が重要なのは、開発者が推論の書き起こしを、モデルが問題をどう解くかを知る不完全な窓としてますます利用しているからだ。内部状態が、式の呼び出し、課題の分解、計算の実行といった活動を区別できるなら、研究者はいずれそれらのプロセスを直接監視したり介入したりできるかもしれない。ただし今回の研究は、これらのパターンで誤りを確実に検出したり、生成をリアルタイムで制御したりできることまでは示していない。
チームは、数学問題を解いているQwen2.5-7B、Qwen3-8B、Gemma4-31Bの3モデルを調べた。研究者は生成された解答をセグメントに分割し、各セグメントを8つの反復的な操作のいずれかに分類した。カテゴリには、情報の抽出、問題の分解、公式の想起、演繹、計算が含まれていた。
The Decoderの報道によると、分類ラベルはGPT-5で生成された。その後、研究者はモデルの内部の数値表現に、そうした操作を区別するのに十分な情報が含まれているかを検証した。
3つのモデルすべてで、分類器は内部表現から推論カテゴリを分離できた。違いは、ネットワークの冒頭や末尾よりも中間層で最も顕著だった。このパターンは、モデルが最初は比較的混ざった形で言語を処理し、その後、より操作特化した内部状態へ整理している可能性を示している。
研究者はまた、一般的な単語が周囲の推論活動に応じて異なる内部表現を取りうることも見いだした。「a」「is」「the」といった語は表層レベルでは多くのカテゴリに現れたが、内部状態は進行中の操作に応じて分かれた。
この結果は、語彙だけに基づく単純な説明に反するため重要だ。トークンそのものを使う分類器は、内部表現を使うものより成績が悪かった。また、解答内でのセグメントの位置も、この分離を説明しなかった。
この研究には、信号が表面的なテキストパターン以上のものであることを示すための複数のテストが含まれていた。ある介入では、研究者が直前30トークンへの注意を遮断した。現在の操作に対応する表現は弱まり、推論ステップは独立に形成されるのではなく、前の文脈に依存していることが示された。
操作カテゴリは、モデルが誤答に至った場合でも識別可能だった。誤った計算でも内部的には計算として見え、公式の想起や演繹はそれぞれの特徴を保っていた。この違いは、モデルが試みているプロセスの種類と、そのプロセスが正しい結果を生んだかどうかを将来的に分けて捉える助けになるかもしれない。
報告された効果はLlama-3-8Bでも再現された。The Decoderによると、Qwen3-8Bでは、あるタスク集合で学習した分類器がGPQA-DiamondとMATH-500に転移した。これらの追加テストは、内部表現が初期例を超えて一般化する可能性を示唆するが、モデルや分野全体での広範な信頼性を示すものではない。
証拠は依然として限定的だ。実験は数学タスクと少数の言語モデルに焦点を当てていた。入手できる報道だけでは、完全なデータセット、分類器の設計、統計的な誤差幅、あるいは研究が独立に再現されたかどうかを十分に評価できない。他分野、より長い推論痕跡、マルチモーダルシステム、実運用規模のモデルへの転移は、現時点の証拠では未検証のままだ。
中心的な含意は、モデルの見えるChain-of-Thoughtが、その内部計算の一部しか表していない可能性があることだ。The Decoderは、Anthropicの先行研究を引用し、モデルが推論で使った手がかりを開示したのは25%から39%のケースにすぎなかったとしている。また、Claude Opus 4.6は出力された推論に現れない情報を処理していることを示唆する研究も挙げている。
この限界は、生成された説明を読むことを前提にした監視システムを難しくする。モデルはもっともらしい説明を出しながら、テキストに現れない内部ステップに依存しているかもしれないし、推論操作を説明しながら実際には正しく実行していないかもしれない。KAISTとNaver AI Labの結果はこの問題を解決しないが、内部表現には進行中の推論の種類に関する構造化された情報が含まれていることを示す証拠にはなる。
モデル研究者にとっての次の機会は、生成中の操作を識別するプローブを訓練することだ。こうしたツールは、予期しない計算をフラグ付けしたり、演繹から根拠のない推測への移行を検出したり、解答が失敗した理由の診断を助けたりする可能性がある。しかし、プロダクトチームにとっては、これらはまだ研究方向であり、すぐに展開できる安全策ではない。
この発見は、より多くのシステムが推論を隠れた数値状態へ移すにつれて、さらに重要になる可能性もある。The Decoderはこの研究を、OpenAI AstraとそのRecurrent Depth技術に結びつけており、これは推論プロセスの一部を通常の可視テキストの外へ移すものだ。モデルがますます内部で計算するなら、生成された説明だけを分析する方法よりも、表現を調べる方法の方が重要になるかもしれない。
最も重要な次の課題は、操作シグネチャが数学の外でも安定しているかどうかだ。コーディング、科学分析、計画、ツール利用でのテストは、これらのパターンが一般的な推論機能を表すのか、それとも主に数学解答の構造を反映しているのかを示すだろう。
研究者はまた、内部信号がモデルの応答が終わる前に誤りを識別できるかどうかを確かめる必要がある。現在の結果は、誤った計算でも計算として認識できることを示しているが、計算がどこで間違ったかを監視できることは示していない。
もう一つの未解決問題は介入だ。研究は、前の文脈を取り除くと信号が弱まることを示したが、表現を強化または変更することでモデルを望ましい操作へ確実に導けることは示していない。より大規模で多様なモデルにわたる再現性も、今後の重要な試験になる。
企業のAI購入者は、隠れた推論について主張する監視ツールに注意を払うべきだ。これらの方法がタスク全体で検証され、敵対的な振る舞いに対して評価されるまでは、内部状態の分析は出力テスト、ツール結果の検証、従来の安全対策を置き換えるのではなく補完するものと考えるべきだ。
この研究は、Chain-of-Thought監視に対する慎重な見方を後押しする。書かれた推論は有用な証拠だが、モデル計算の完全な記録ではない。研究者が特定した内部パターンは、モデルが推論活動の違いを符号化していることを示しているが、プロセスを特定することと、それを評価・制御することの間にはなお大きな隔たりがある。
開発者にとっての実践的な教訓は、解釈可能性プローブを新たな診断レイヤーとして扱うことだ。特に推論の多くを隠すシステムでは、将来的にモデルのデバッグや安全性評価を支えるかもしれない。現時点で証拠が最も強く支持する主張は、より限定的だ。すなわち、内部表現には、たとえ答えが誤っていても、モデルがどのような種類の推論ステップを実行しているように見えるかについての構造化された信号が含まれている、ということだ。