KAIST 與 Naver AI Lab 的研究發現,模型在內部編碼了不同的推理操作,為 AI 監督帶來新的可能性與限制。

一項來自南韓 KAIST 與 Naver AI Lab 研究人員的研究發現,AI 模型書面解答中可見的多種推理操作,也會以可分離的模式出現在其內部表徵中。這項訊號在受測模型的中間層最強,顯示內部活動可能比最終文字本身更能揭示模型的計算過程。
這項發現之所以重要,是因為開發者越來越常把書面推理當作觀察模型如何解題的一扇不完美窗口。如果內部狀態能區分像是提取公式、拆解任務或執行計算等活動,研究人員未來或許就能直接監控或干預這些過程。不過,這項研究尚未顯示這些模式能可靠地偵測錯誤,或即時控制生成。
團隊檢視了三個模型——Qwen2.5-7B、Qwen3-8B 與 Gemma4-31B——在解數學題時的表現。研究人員將生成的解答切分成片段,並將每個片段歸類為八種反覆出現的操作之一。這些類別包含擷取資訊、將問題拆解為多個部分、回想公式、演繹,以及計算。
根據 The Decoder 對研究的報導,分類標籤是使用 GPT-5 產生的。接著,研究人員測試模型內部的數值表徵是否含有足夠資訊來區分這些操作。
在三個模型中,分類器都能從內部表徵中區分推理類別。這種區分在中間層最為明顯,而非在網路的開頭或結尾。這種模式顯示,模型一開始可能以相對混雜的形式處理語言,之後再將其整理成更具操作特異性的內部狀態。
研究人員也發現,常見字詞會因周遭的推理活動不同,而擁有不同的內部表徵。像「a」、「is」和「the」這類詞彙在表面上會出現在許多類別中,但其內部狀態會依正在進行的操作而分離。
這個結果很重要,因為它反駁了只依賴詞彙的簡單解釋。使用 token 本身的分類器表現比使用內部表徵的分類器更差。解答中片段的位置也無法解釋這種分離。
這項研究包含幾項測試,旨在證明訊號反映的不只是表面的文字模式。在一項介入中,研究人員阻斷了對前 30 個 token 的注意力。與當前操作相關的表徵因此變弱,顯示某個推理步驟依賴先前脈絡,而非獨立形成。
當模型得出錯誤答案時,操作類別仍然可辨識。錯誤的計算在內部看起來仍像計算,而公式提取與演繹則保有各自的特徵。這種區分或許有助於研究人員將模型試圖執行的流程類型,與該流程是否產生正確結果區分開來。
報告中的效果也在 Llama-3-8B 上獲得複現。根據 The Decoder,對 Qwen3-8B 而言,使用某一組任務訓練的分類器可轉移到 GPQA-Diamond 與 MATH-500。這些額外測試顯示,這些表徵可能能超越初始範例而泛化,但並不能證明跨模型或跨領域具備廣泛可靠性。
目前證據仍然有限。實驗聚焦於數學任務與少數語言模型。現有報導未提供足夠細節來評估完整資料集、分類器設計、統計誤差範圍,或研究是否已被獨立重現。對其他領域、更長的推理軌跡、多模態系統,以及生產規模模型的轉移,在現有證據中仍未被測試。
核心意涵是,模型可見的 Chain-of-Thought 可能只是其內部計算的一部分。The Decoder 引用 Anthropic 先前的研究指出,模型在推理中透露所用線索的比例僅為 25% 到 39%。它也提到有研究顯示,Claude Opus 4.6 會處理其輸出推理中未出現的資訊。
這項限制使以閱讀生成解釋為基礎的監督系統變得更複雜。模型可能一邊產出看似合理的解釋,一邊依賴文本中沒有出現的內部步驟;也可能描述某個推理操作,卻沒有正確執行。KAIST 與 Naver AI Lab 的結果並未解決這個問題,但它提供了證據顯示,內部表徵中包含了關於正在進行的推理類型的結構化資訊。
對模型研究人員而言,下一個機會是訓練能在生成過程中識別操作的探針。這類工具有望標記意外的計算、偵測從演繹轉向缺乏依據的猜測,或幫助診斷解答為何失敗。不過,對產品團隊來說,這些可能性目前仍屬研究方向,而非可立即部署的保護措施。
隨著更多系統把推理移入隱藏的數值狀態,這項發現也可能變得更重要。The Decoder 將此研究連結到 OpenAI Astra 及其 Recurrent Depth 技術,該技術會將部分推理過程移出一般可見文字之外。如果模型愈來愈多在內部完成計算,那麼檢視表徵的方法可能會比只分析生成解釋的方法更重要。
最重要的後續問題,是這些操作特徵在數學之外是否仍然穩定。對程式撰寫、科學分析、規劃與工具使用的測試,將顯示這些模式是在描述一般推理功能,還是主要反映數學解題的結構。
研究人員也需要判斷,內部訊號是否能在模型完成回應前辨識錯誤。目前結果顯示,錯誤的計算仍可被辨識為計算;但它並未顯示監測器能知道計算何時出錯。
另一個未解問題是介入。研究證明,移除前文脈會削弱訊號,但並未顯示強化或修改某個表徵能可靠地引導模型走向預期的操作。更大且更多樣化模型上的可重現性,將是另一項關鍵測試。
企業 AI 採購者應關注那些宣稱能偵測隱藏推理的監控工具。在這些方法尚未通過跨任務驗證、且未針對對抗性行為進行評估前,內部狀態分析應作為補充,而非取代輸出測試、工具結果驗證與傳統安全控管。
這項研究為對 Chain-of-Thought 監控的審慎看法增加了分量:書面推理是有用的證據,但不是模型計算的完整逐字稿。研究人員所辨識出的內部模式顯示,模型確實將不同推理活動加以編碼;然而,辨識一個過程與評估或控制它之間仍有相當大的落差。
對建構者而言,實務上的啟示是:將可解釋性探針視為一個新興的診斷層。它們未來或可支援模型除錯與安全評估,特別是對那些隱藏更多推理過程的系統。就目前而言,證據所支持的最強論點較為狹窄:即使答案是錯的,內部表徵仍包含有關模型似乎正在執行哪一類推理步驟的結構化訊號。