AI News

Anthropic 的 Claude Opus 5 在 ARC-AGI-3 上拿下目前已公布的最高位置。ARC-AGI-3 是一項專門用來測試 AI 系統如何處理陌生互動式問題,而不是回想訓練資料中的模式的基準測試。根據 The Decoder 引述 ARC Prize 結果的報導,Claude Opus 5 在 ARC-AGI-3 上拿到 30.2%,大幅領先 OpenAI 的 GPT-5.6 Sol (Max) 先前公布的最佳成績 7.8%。

這樣的差距已經不只是排行榜上的話題而已。對 AI 開發者與企業團隊來說,ARC-AGI-3 正被視為一種代理指標,用來觀察前沿模型是否在新環境中的規劃、適應與多步驟解題能力上持續進步。如果這個結果反映的是更廣泛的能力提升,而不是狹窄的優化,那麼這表示 Anthropic 正在改善 AI 代理、程式設計系統,以及那些必須在沒有人工搭建輔助架構下從錯誤中恢復的工作流程工具所需的推理能力。

ARC-AGI-3 有什麼改變

這項已公布的結果來自 ARC Prize 團隊,該團隊負責開發與維護 ARC-AGI 基準系列。更新版 ARC-AGI-3 被設計成一種互動式、類遊戲測試:模型必須推斷隱藏規則、選擇動作,並一步一步執行。這使它不同於許多靜態基準,因為後者可能會獎勵死記硬背的格式或表面上的模式匹配。

根據 The Decoder 的報導,Claude Opus 5 解出了五個先前未解開的 ARC-AGI-3 環境。其中四個據稱解到了人類水準或更高。ARC Prize 也表示,在 25 個公開示範環境中,目前總共有 6 個已被解開,且公開結果、重播與程式碼都可取得。

文章還指出,Claude Opus 5 的表現優於 Anthropic 自家的「Fable-class」模型;ARC Prize 據稱將這些模型在 ARC-AGI-3 上的表現評為約 20%。這讓這次躍升不只是相較於 GPT-5.6 Sol 顯得突出,也在 Anthropic 自家近期模型系列中相當值得注意。

在這個基準測試家族的舊版本上,提升看起來沒有那麼戲劇化。根據 The Decoder,Claude Opus 5 在 ARC-AGI-2 上達到 90.4%,在 ARC-AGI-1 上達到 97.5%,與先前最高分相當,但依 ARC Prize 的分析,成本稍高。換句話說,這次最吸睛的提升主要集中在最新、也可能最難的版本上。

為什麼研究者認為這個分數有意義

對這個結果最強的詮釋來自 ARC Prize 研究人員,而不是 Anthropic 本身。根據 The Decoder 引述與整理,該基準團隊把領先歸因於更強的邏輯推理,讓模型在陌生環境中能更自主地探索、規劃與執行。

最引人注目的細節不是數字,而是質性表現。在測試過程中,Claude Opus 5 據報把任務轉換成代數表示法,並自主建立「reflection equations」;ARC Prize 研究人員表示,他們過去從未在這個情境下見過其他模型出現這種行為。如果這項描述經得起更廣泛檢驗,這代表模型不只是嘗試更多動作,而是在建立更明確的內部問題表徵。

這很重要,因為像 Claude Opus 5 這類系統的核心承諾,不只是更好的聊天品質而已。更重要的是,它們有潛力能觀察新環境、找出規則、修正失敗策略,然後繼續前進。這正是軟體開發、資料工作、研究協助,以及後台自動化中可靠 AI 代理所需要的特性。

不過,這個基準本身也帶有一種影響解讀方式的哲學。ARC Prize 區分語言模型的原始能力,以及由外部 harness 增強後的表現。某些系統可能在加入額外協調軟體後表現更好,但官方 ARC-AGI 評分強調的是模型本身的表現。The Decoder 指出,ARC Prize 認為未來類 AGI 系統不應該在真正新穎的任務上還需要外部協助。

基準測試導向優化的問題並沒有消失

這個結果很亮眼,但它並沒有解決長期以來的疑問:前沿模型究竟是變得更普遍地聰明了,還是只是更適合某些特定測試。

The Decoder 報導稱,Anthropic 目前尚未公開解釋這次進步的來源。可能的機制包括:針對性的資料標註、強化學習,以及 Claude Opus 5 是在 ARC-AGI-3 之後才開發、而且該格式已經公開。這個時間點很重要。一旦基準格式為人所知,模型開發者就能針對它所獎勵的抽象能力、互動循環與謎題結構進行訓練,而不一定需要直接訓練那些被保留的測試題。

這不會讓結果失去意義,但會縮小我們能從中得出的結論。ARC-AGI-3 上更好的表現,可能反映的是探索與規則推理能力的真實提升;也可能只是對現在已公開可見的某類任務進行集中優化。這兩種解釋並不互斥。

The Decoder 引述的另一項測試,讓這種張力更明顯:Witness,一個由研究者 Guanghan Ning 建立的私有互動式益智遊戲基準。在 Witness 上,Claude Opus 5 據稱拿到 43.4,與 Kimi K3 和 Fable 5 在統計上打平。那裡相較於 Opus 4.8 的提升遠小於 ARC-AGI-3,而且據稱在至少一款機制較不熟悉的遊戲中,Opus 5 還落後於 Opus 4.8。

Ning 告訴 The Decoder,這種模式可能符合在特定類型資料上訓練的結果;但他後來也補充說,Claude Opus 5 確實能泛化到 Witness,只是程度遠不如 ARC-AGI-3。The Decoder 指出、並將 Greg Kamradt 認定為 ARC-AGI-3 背後研究者之一;他認為,一個較弱的結果無法抵銷整體進步,而 Witness 的設計與 ARC-AGI-3 類型謎題之間的重疊,可能反映了真實的遷移能力。

目前最公平的解讀是:Claude Opus 5 在至少一個重要的互動式推理基準上明顯更強,但這項提升能否廣泛轉移到其他無關任務,仍然是個開放問題。

證據、主張,以及哪些內容已被驗證

這裡的證據基礎比標題暗示的還要窄。整體內容建立在 The Decoder 對 ARC Prize 基準結果的報導之上。在所提供的證據裡,沒有 Anthropic 直接發布的技術文章去解釋模型變更、訓練方法或評估條件。

有幾項事實從報導來看相對明確:Claude Opus 5 在 ARC-AGI-3 上拿到 30.2%;GPT-5.6 Sol (Max) 先前公布的最佳成績是 7.8%;ARC Prize 已經公開結果、重播與基準測試程式碼。這些都是 The Decoder 轉述的基準報告事實。

其他重要觀點則屬於解讀,而非已確定的原因。「這代表真正更好的推理」是 ARC Prize 的判斷。至於針對性資料標註或強化學習是否解釋了這次提升,這是 The Decoder 對可能原因的分析,而不是 Anthropic 已確認的說明。同樣地,擔心公開的基準格式會誘導針對特定任務的優化,這是合理的方法論警告,但並不是過度擬合或資料污染的證明。

買家與開發者也應記住,基準勝利並不會直接對應到部署表現。某個模型即使在 ARC-AGI-3 上領先,到了延遲、成本、工具使用、可控性或生產環境的整合限制上,仍可能表現不佳。The Decoder 指出,Claude Opus 5 在 ARC-AGI-1 和 ARC-AGI-2 上與先前最佳成績持平,但成本略高,這提醒我們:能力與效率不一定會同步提升。

這對開發者與企業團隊意味著什麼

對於正在打造 AI 代理的團隊來說,Claude Opus 5 的結果最重要的意義在於:它顯示模型在陌生工作流程中的自主復原能力。如果模型更能推斷隱藏規則,並在過程中調整策略,這可能改善程式碼輔助產品、瀏覽器自動化、資料擷取,以及需要處理脆弱介面的企業 AI 系統。

對於拿 Anthropic 與 OpenAI 比較的產品團隊來說,這個相對 GPT-5.6 Sol 的直接基準差距,會讓模型選擇問題更加尖銳。但正確的教訓不是只根據一個分數就立刻換供應商。團隊應該用自己的失敗模式來測試 Claude Opus 5、GPT-5.6 Sol,以及像 Kimi K3 這樣的替代方案:長跨度任務、模糊指令、工具錯誤與全新的邊緣案例。

對企業 AI 採購方來說,harness 之爭也很重要。許多商業部署依賴協調層、檢索、外部記憶與工具包裝器。ARC-AGI-3 強調原始模型能力很有用,因為它把模型本身隔離出來,但生產系統很少這樣運作。高的原始分數或許能讓系統設計更簡單,卻不能取代防護措施、監控,以及針對工作流程的評估。

另一個戰略含意是競爭面。如果 Anthropic 能持續展現互動式推理上的進展,而不只是對話表現更精緻,那麼它在程式設計、代理式工作流程,以及高信任企業任務上的地位就會更強。即使絕對分數仍遠未完美,這正是基準領先可能影響平台決策的地方。

接下來要關注什麼

下一個要觀察的訊號是獨立重現。研究者會想看看公開的重播與程式碼,是否支持 Claude Opus 5 以實質不同的方式發現規則,而不只是做出更好的搜尋步驟。

第二,要關注更廣泛的遷移能力。Witness 以及其他私有或持續更新的基準結果,會比只再跑一次 ARC-AGI-3 更有意義。如果 Claude Opus 5 在不同機制的任務上也展現類似提升,那麼真正推理能力進步的說法就會更有說服力。

第三,要關注 Anthropic 的進一步揭露。若有關於訓練變更、強化學習設定或資料整理的任何技術細節,都能幫助市場判斷這次躍升是來自一般能力提升,還是來自針對基準測試的準備。

最後,也要觀察競爭者的回應。隨著前沿實驗室更快適應已知的基準格式,OpenAI、ARC Prize 與獨立評估者可能會面臨更大壓力,必須發布更困難、更多變的測試。

Creati.ai 觀點

Claude Opus 5 在 ARC-AGI-3 上的分數很重要,因為它顯示了業界一直難以清楚衡量的一類能力正在進步:對陌生互動式問題的適應。這比許多已經飽和的文字基準更貼近真實產品。不過,這個結果應被視為一個強而有力的數據點,而不是「真正智慧」已經被解決的判決。

更深層的啟示在於評估。當像 ARC-AGI 這樣的基準成為重要目標,前沿實驗室就會針對它們優化。這也使得透明報告、更新的測試設計,以及跨基準驗證變得不可或缺。對創辦人與企業團隊來說,實際做法很簡單:先把 Claude Opus 5 視為在代理式任務上新近可信的選項,但在把這種基準飛躍當成生產真實之前,務必在自己的環境中先行驗證。

精選

Anthropic 的 Claude Opus 5 在 ARC-AGI-3 取得明顯進展,但基準測試之爭只會越來越大聲

Anthropic 的 Claude Opus 5 在 ARC-AGI-3 創下新高分,也再次引發人們對於真正推理能力提升,還是只是針對基準測試優化的疑問。