元AlphaGo研究者のThore Graepelは、LLMには単に長い思考の連鎖ではなく、監査可能な信念状態と探索が必要だと主張している。

大規模言語モデルは、手順を追った回答を生成する能力を高めている。しかし、その一見した熟考が必ずしも推論を意味するわけではないと、Google DeepMindの元研究者でAlphaGoチームの中核メンバーだったThore Graepelは述べている。
MIT Technology Reviewに掲載された分析で、Graepelは、現在のLLMは本質的には依然として次のトークンを予測するシステムだと論じている。信頼できる機械知能には、信念を記録し、可能な説明を検証し、証拠に基づいて結論を更新し、意思決定の過程を検査可能にする、独立した推論アーキテクチャが必要だという。
この議論が重要なのは、AI開発者や企業の導入担当者が、コーディング、研究、診断、計画など、もっともらしい回答だけでは不十分な作業にモデルをますます展開しているからだ。Graepelの提案は、製品発表でも新しいベンチマーク結果でもない。最近Google DeepMindを離れ、AI開発に別の方向性を求めている著名な研究者による技術的批判である。
Graepelの中心的な区別は、流暢なパターン補完と熟考的な推論の間にある。LLMは、データから学習した統計的関係に基づいて、1つずつトークンを生成する。その過程は有用な説明や数学的解答、コードを生み出せるが、モデルが中間ステップを生成する場合でも、基礎にある仕組みは変わらない。
こうした中間ステップは一般に思考の連鎖と呼ばれる。Graepelは、思考の連鎖が、特に数学やコーディングで性能を向上させる可能性を認めている。だが、より多くの文章を生成しても、独立した推論システムが生まれるわけではないと指摘する。モデルは、命題や仮説の明示的な集合を操作するのではなく、次のトークンの予測によって依然として一つの系列を延長している。
彼は3つの弱点を挙げている。現在のモデルには一般に、何を信じているのか、どの程度確信しているのか、各主張を支える証拠は何か、どの問いが未解決なのかを記録した、永続的で検査可能な記録がない。また、保存された知識と、それを操作するための処理を、知識と推論に明確な分離を設けるのではなく、ニューラルネットワークの重みに組み込んでいる。さらに、文章による説明が、回答がどのように生成されたかを忠実に表しているとは限らない。
最後の問題は、重大な結果を伴うシステムにとって特に重要だ。AIが医療、工学、科学研究で誤りを犯した場合、ユーザーは、その失敗が不十分な証拠、妥当でない仮定、誤った推論のどれに起因するのかを特定する必要がある。回答の後に生成された説得力のある説明では、その診断に必要な情報を提供できない可能性がある。
Graepelは、現代のAIに必要だと考えるアーキテクチャの例としてAlphaGoを使っている。2016年、韓国のチャンピオンである李世乭(イ・セドル)との対局で、AlphaGoは「37手目」として知られる異例の手を打った。当初はミスのように見えたが、AlphaGoは最終的にその対局に勝利し、シリーズも4勝1敗で制した。
Graepelによれば重要なのは、その手が直感だけから生まれたものではないことだ。AlphaGoは、有望な手を推定するニューラル方策ネットワークと、可能な続き方を探索する検索システムを組み合わせた。検索システムは、代替となる局面と将来の手を含むゲーム木を構築し、行動を選択する前に各分岐を評価した。
この設計では、ニューラルネットワークが高速な判断を提供し、探索が構造化された熟考を担った。Graepelは、この構成を、素早く直感的な思考と、より遅く分析的な思考の行動上の区別になぞらえている。2つの構成要素は相互に支え合った。直感が可能性を絞り込み、探索が将来の結果に照らしてそれらの可能性を検証したのである。
ただし、この比較には限界がある。囲碁には、定義された盤面、固定された合法手の集合、各手の結果を決めるルールがある。科学やビジネスの開かれた問題には、そのような条件はない。世界の状態は不完全で、取れる行動は変化し、結果は不確実になり得る。
それでもGraepelは、このアーキテクチャが有用なひな型を示すと述べている。汎用的な推論システムは、「認識論的状態」、つまり確定した主張、疑念、棄却された説明、未解決の問い、裏付けとなる証拠を構造化した記録を維持できるだろう。推論の各ステップは、単に生成テキストを追加するのではなく、その状態を更新することになる。
この記事における最も強い主張は、GraepelがMIT Technology Reviewに寄稿した分析に基づくものであり、新たに報告された実験や独立した製品評価に基づくものではない。記事はAlphaGoの歴史とアーキテクチャについて詳しく説明しているが、現在のLLMと、提案されている認識論的状態システムを比較する新たなベンチマークは提示していない。
Graepelはまた、言語モデルが、回答に至ったプロセスを必ずしも忠実に反映しない説明を生成し得ることを示す研究にも言及している。ここで示された記事は、研究、データセット、モデル結果を十分な詳細で特定していないため、その影響の大きさや一般性をここで評価することはできない。
この区別は重要だ。この批判は、現在のモデルが役に立たない、あるいは複数段階の問題を解けないという意味ではない。ある課題での性能を、代替案、証拠、信念の更新を明示的に追跡するシステムと同じ意味でモデルが推論している証拠だと、自動的に見なすべきではないという意味である。
記事では、Graepel自身の設計方針も紹介されている。彼は、LLMに戦略を提案させ、APIやコードを通じてツールとやり取りさせ、主張が証拠に裏付けられているかを評価させることを提案している。そのうえで、独立した評価器が、システムによる知識更新を許可する前に、各ステップが実際に不確実性を減らしているかを判断する。
AI開発者にとっての実際のシグナルは、新しいシステムが、より長いプロンプトやより長い生成推論の軌跡を超えるかどうかになる。開発者は、検査可能な中間状態を維持し、事実に関する記憶と推論手続きを分離し、証拠が結論をどのように変えたかを記録するアーキテクチャに注目すべきだ。
ツール利用も重要な領域になる。コードを実行し、データベースを検索し、文書を取得し、実験を設計できるシステムは、そうした行動が言語モデルの回答を飾るものとして扱われるのではなく、明示的な検証と結び付いていれば、より信頼できるようになる可能性がある。重要なのは、エージェントが単にツールを呼び出すかではなく、その結果が追跡可能な形で構造化された信念状態を変えるかどうかだ。
企業の導入担当者は、モデルの意思決定をどのように監査し、失敗を再現し、取得した証拠と生成された主張を区別しているのかをベンダーに尋ねるべきだ。現在の思考の連鎖インターフェースは、回答をより推論的に見せることはできても、基礎にあるプロセスをより検証可能にするとは限らない。
一方、研究者は、AlphaGoに着想を得たアーキテクチャが、過度に高コストになったり遅くなったりせずに、開かれた世界の課題に対応できるかを示す必要がある。多くの仮説を維持・評価することは信頼性を高める可能性がある一方、計算量、遅延、エンジニアリングの複雑さ、更新ごとの検証負担を増大させる可能性もある。
Graepelの提言は、AI業界が進歩をどう呼ぶかに対する問題提起として理解するのが最も適切だ。推論ベンチマークでの性能向上や、より精緻な説明には価値がある。しかし、それだけでモデルが監査可能な推論プロセスを持つことを示すわけではない。
より難しい試験は運用面にある。システムは不確実性を保持し、結論の根拠となる証拠を示し、新しい情報が入ったときに信念を修正し、どこで失敗したかを明らかにできるだろうか。AIが科学的発見、医療、その他の重大な結果を伴う業務を支援するなら、こうした能力はモデルの規模そのものと同じくらい重要になるかもしれない。次世代のAIシステムは、生成する回答だけでなく、ユーザーがそこに至る道筋を検査し、信頼できるかどうかによっても評価されることになる。