
Moonshot AI 推出了 PerceptionBench,這是一個旨在測試多模態 AI 模型是否能在被要求推理之前,正確解讀影像的基準測試。The Decoder 報導的評測結果顯示,在受測的 16 個前沿模型中,沒有任何一個整體準確率達到 60%,表現最佳的系統也只有 59.7%。
這個結果之所以重要,是因為許多被歸因於推理能力不足的失誤,可能在更早階段就已經發生:模型可能誤讀影像、數錯數量、漏看視覺關係,或憑空想像出並不存在的物體。PerceptionBench 嘗試將這個第一階段與一般知識和多步驟推理分離,讓 AI 開發者能更精準地診斷多模態失誤。
Moonshot AI 的研究團隊,同時也是 Kimi 助理的開發者,表示 PerceptionBench 評估的是獨立於邏輯推理與外部知識之外的視覺感知。每一道題目都設計成可直接從影像本身作答。
這個基準將感知拆分為十個技能領域:視覺關係、計數、屬性、深度與 3D 理解、定位、比較、細粒度辨識、情境整合、光學字元辨識,以及幻覺。據報導,這些分類是從觀察到的模型錯誤中歸納出來的,而非純理論式的分類法。
團隊分析了 42 個既有的開源基準,發現其所測量的錯誤之間重疊有限。因此,Moonshot AI 建立了一個超過 17,000 題經驗證問題的內部題庫,並釋出 3,000 項任務。根據 The Decoder 的說法,公開題目中有 60% 來自已記錄的模型錯誤,其餘則透過增強影像重新表述。
公開資料集與評測程式碼可透過 GitHub 上的 MoonshotAI/PerceptionBench 專案取得。這次釋出應能讓研究人員與模型開發者測試,這些被報告的弱點是否會在 Moonshot AI 自身評測流程之外重現。
The Decoder 報導,GPT-5.6 Sol 以 59.7% 拿下最高整體成績,接著是 Kimi K3 的 58.5%、Claude Fable 5 的 57.2%、Gemini 3.1 Pro 的 56.2%,以及 GPT-5.5 的 55.8%。報告中列出的開源模型包括 Qwen3.5-397B-A17B 的 47.5% 與 GLM-4.6V 的 32.5%。
這些數字應被視為 The Decoder 報導的基準結果,而非多模態能力的通用排名。效能可能因提示詞、影像構圖、任務選擇與評測設計而有所不同。這些模型與分數在來源資料中 प्रस्तुत 時,也沒有本文可取得證據中的獨立重現。
按類別呈現的結果似乎比排行榜更有啟發性。據報導,總分相近的模型在不同技能上差異很大。平均來看,幻覺是最弱的一項:GPT-5.6 Sol 在該子測試僅得 26.9%,而 Gemini 3.5 Flash 儘管整體排名較低,據報卻達到 50.6%。這項任務測試的是,當影像中根本沒有被詢問的物體時,模型能否正確回答「零」,而不是憑空捏造一個。
這種模式顯示,單一多模態分數可能掩蓋特定工作流程中的嚴重弱點。模型也許能可靠閱讀影像中的文字,但在計數、空間比較,或判斷某個物體是否真的存在時卻不可靠。
許多生產任務結合了視覺解讀與一連串決策。助理可能先查看儀表板、辨識警示、比較兩張產品圖,再建議下一步行動。如果第一個視覺觀察就是錯的,後續推理即使內部一致,仍可能導致錯誤答案。
PerceptionBench 的做法是把複雜問題拆解為只涉及感知的子問題。Moonshot AI 研究人員認為,這使得找出最早失敗的步驟成為可能,而不是把整個結果都標記為推理錯誤。
這項發現與 The Decoder 引用的早期研究一致,儘管那些研究使用的是不同測試。WorldVQA 基準據稱發現,其表現最佳的模型在將物體辨識與推理分離的任務上得分為 47.4%。另一項使用 BabyVision 的研究則報告,Gemini 3 Pro 在基本視覺任務上達到 49.7%,相較之下人類為 94.1%。來源將這一差距歸因於語言化瓶頸,也就是視覺資訊在轉換為語言時失真。
這些比較並不能證明所有多模態系統都以相同方式失敗,但它們強化了 PerceptionBench 背後更狹義的重點:強大的語言生成與廣泛的推理表現,並不保證穩定可靠的視覺輸入處理。
對建置者而言,眼前的影響是架構層面的,而非表面上的美觀問題。多模態模型不能因為能流利描述一張圖片,就被自動信任去做計數、庫存檢查、文件擷取、空間導航或視覺品質控制。
部署視覺系統的團隊,可能需要針對影響其工作流程的特定失敗模式做專門評測。零售系統應測試物體是否存在以及細粒度屬性。文件產品應測量 OCR 與版面解讀。機器人或工業應用則應在加入規劃或工具使用之前,分別評估定位、深度與空間關係。
這個基準也支持在高影響力的視覺輸出周圍加入驗證步驟。當錯誤的計數或漏掉的警示可能帶來財務、安全或合規後果時,第二個模型、傳統電腦視覺工具、結構化擷取或人工審查都可能適用。這些防護措施會增加延遲與成本,但 PerceptionBench 的分數顯示,流暢的回答並不足以證明感知正確。
對模型供應商來說,這次釋出會迫使他們不只報告整體多模態基準,也要報告分類別結果。比較 GPT-5.6 Sol、Kimi K3、Claude Fable 5 或 Gemini 3.1 Pro 的開發者,可能會因為優先項目是 OCR、抗幻覺、計數,還是空間理解,而得出不同結論。
首先要觀察的是,PerceptionBench 的結果是否能在不同模型版本與推理設定下被獨立重現。由於基準與程式碼都是公開的,外部評估可測試這些差距是否會超出 Moonshot AI 的設定仍然存在。
研究人員也應檢視資料污染與任務構造,特別是源自已知模型錯誤的題目比例,以及增強影像帶來的影響。這些細節有助於判斷,這個基準是在測量一般視覺能力,還是強烈鎖定作者已觀察到的失敗模式。
對買家而言,下一個有用的問題不只是誰在整體榜單上居首,而是供應商是否公布可信、按類別區分的結果,以及這些改進是否能轉移到真實影像、變動版面、雜訊攝影機輸入,以及生產環境中的邊緣案例。
PerceptionBench 最有價值之處在於它是一個診斷型基準,而不是對多模態 AI 的最終判決。它的核心貢獻是將「看」與「推理」分開,而許多產品評測往往把這兩者混在一起。模型可以很有說服力地解釋一張圖片,但仍可能錯判圖片裡到底有什麼。
對 AI 團隊來說,實際教訓很直接:測試工作流程所依賴的視覺原子能力,衡量失誤成本,並在感知錯誤可能擴散的地方加入驗證。在多模態系統對這些看似簡單的任務變得更可靠之前,模型選擇應根據具體的視覺工作,而不只是一般能力分數。
Moonshot AI 的 PerceptionBench 發現,領先的多模態模型在基本視覺任務上的表現仍低於 60%,揭示看似推理錯誤背後的感知失誤。