前 AlphaGo 研究員 Thore Graepel 認為,LLM 需要可稽核的信念狀態與搜尋機制,而不只是更長的思考鏈。

大型語言模型在產生逐步回答方面已經有所進步,但這種表面上的思考過程不一定等同於推理。Google DeepMind 前研究員、AlphaGo 團隊核心成員 Thore Graepel 如此表示。
在 MIT Technology Review 發表的一篇分析中,Graepel 認為,目前的 LLM 從根本上仍是下一個 token 預測系統。他表示,值得信賴的機器智慧需要一套獨立的推理架構,能夠記錄信念、測試可能的解釋、根據證據更新結論,並讓決策過程可供檢查。
隨著 AI 開發者與企業買家越來越多地將模型部署於程式設計、研究、診斷、規劃及其他僅有合理答案仍不足夠的工作,這項論點格外重要。Graepel 的提議不是產品公告,也不是新的基準測試結果,而是一位近期離開 Google DeepMind 的知名研究員所提出的技術批判,呼籲 AI 發展走向不同方向。
Graepel 的核心區分,在於流暢的模式補全與審慎推理之間的差異。LLM 根據從資料中學到的統計關係,一個接一個地產生 token。即使模型產生了中間步驟,這個過程仍能產生有用的解釋、數學解答與程式碼,但其底層機制並沒有改變。
這些中間步驟通常被稱為思考鏈。Graepel 承認,思考鏈能夠提升效能,尤其是在數學與程式設計方面。但他的反對理由是,產生更多文字並不會創造獨立的推理系統。模型仍是透過預測下一個 token 來延伸序列,而不是操作一組明確的命題或假設。
他指出三項弱點。目前的模型通常缺乏一份持續且可檢查的紀錄,說明它們相信什麼、確信程度如何、哪些證據支持各項主張,以及哪些問題仍未解決。它們也把儲存的知識與操作知識的程序一併結合在神經網路的權重中,而不是將知識與推理清楚分開。最後,它們寫出的解釋可能無法忠實反映答案是如何產生的。
最後一個問題對高風險系統尤其重要。如果 AI 在醫療、工程或科學研究中犯錯,使用者需要判斷失敗究竟來自不良證據、無效假設,還是錯誤推論。在答案產生後才生成的有說服力解釋,可能無法提供這些診斷資訊。
Graepel 以 AlphaGo 說明他認為現代 AI 所需的架構。2016 年與南韓棋王李世乭對弈時,AlphaGo 下出了一步被稱為第 37 手的異常棋步。這一步起初看起來像是錯誤,但 AlphaGo 最終贏得該局,並以 4 比 1 贏得整場對弈。
Graepel 認為,關鍵在於這一步並非單靠直覺產生。AlphaGo 將估計有希望棋步的神經網路策略網路,與探索可能後續走法的搜尋系統結合。搜尋系統建立包含替代局面與未來棋步的遊戲樹,然後在選擇行動前評估各個分支。
在這項設計中,神經網路提供快速判斷,而搜尋則提供結構化的審慎思考。Graepel 將這種安排比作快速、直覺式思考與較慢、分析式思考之間的行為差異。兩個元件彼此支援:直覺縮小可能性範圍,而搜尋則根據未來後果測試這些可能性。
這項比較有其限制。圍棋有明確的棋盤、固定的合法行動集合,以及決定每一步結果的規則。科學或商業中的開放式問題並不具備這些條件。世界狀態並不完整,可採取的行動會變化,後果也可能不確定。
即便如此,Graepel 表示,這種架構仍提供了有用的範本。通用推理系統可以維持一種「認識論狀態」——將已確立的主張、疑問、遭駁回的解釋、未解決問題與支持證據結構化記錄下來。每一個推理步驟都會更新這個狀態,而不只是加入更多生成文字。
本文最強的主張來自 Graepel 在 MIT Technology Review 發表的分析,而不是新近報導的實驗或獨立產品評估。文章提供了 AlphaGo 的歷史與架構細節,但沒有提出新的基準測試,將目前的 LLM 與所提議的認識論狀態系統進行比較。
Graepel 也提到,有研究顯示語言模型可能產生無法可靠反映其答案形成過程的解釋。本文所提供的文章沒有以足夠詳細的方式列出具體研究、資料集或模型結果,因此無法在此評估該效應的規模或普遍性。
這項區分很重要。這項批判並不表示目前的模型毫無用處,或無法解決多步驟問題。它表示,不應自動將模型在某項任務上的表現視為其推理方式與明確追蹤替代方案、證據及信念修正的系統相同的證明。
文章也介紹了 Graepel 自己的設計方向。他提議使用 LLM 來提出策略,透過 API 或程式碼與工具互動,並評估主張是否有證據支持。接著,獨立評估者會在允許系統更新知識前,判斷每一步是否確實降低了不確定性。
對 AI 開發者而言,實際訊號將是新系統是否超越更長的提示詞與更長的生成推理軌跡。開發者應留意能維持可檢查中間狀態、將事實記憶與推理程序分開,並記錄證據如何改變結論的架構。
工具使用也將是另一個關鍵領域。能夠執行程式碼、查詢資料庫、擷取文件或設計實驗的系統,如果這些行動與明確測試相連,而不是被當成語言模型回答周圍的裝飾,可能會變得更可靠。真正重要的問題不只是代理是否呼叫工具,而是結果是否以可追蹤的方式改變結構化的信念狀態。
企業買家也應詢問供應商如何稽核模型決策、重現失敗,以及區分擷取到的證據與生成的主張。現有的思考鏈介面可能讓答案看起來更有推理性,卻不一定讓底層過程更容易驗證。
與此同時,研究人員需要證明受 AlphaGo 啟發的架構能否處理開放世界任務,而不會變得過於昂貴或緩慢。維持並評估許多假設可能提升可靠性,但也可能增加計算量、延遲、工程複雜度,以及驗證每次更新的負擔。
Graepel 的介入,最好被理解為對 AI 產業如何標示進步的一項挑戰。在推理基準測試中取得更佳結果,以及提供更詳盡的解釋,確實具有價值;但這些本身並不能證明模型擁有可稽核的推理過程。
更艱難的測試在於實際運作:系統能否保留不確定性、揭示結論背後的證據、在新資訊出現時修正信念,並指出失敗發生的位置?如果 AI 要支援科學發現、醫療及其他後果重大的工作流程,這些能力可能與模型本身的規模同等重要。下一代 AI 系統不只會根據它們產生的答案受到評估,也會根據使用者能否檢查並信任它們取得答案的途徑而受到評估。