Google 的 Gemini 4 Argon 縮小與前沿模型的差距,但未明確領先

Google 的 Gemini 4 Argon 在一項指標上追平 OpenAI 的 GPT-6 Astra,落後於 Anthropic 的頂尖模型,並首先向選定測試者推出。

AI News

Google 發表了 Gemini 4 Argon,這款全新旗艦模型讓公司在超過七個月未推出新前沿模型後,重新與 OpenAI 和 Anthropic 展開直接競爭。早期測試顯示,Argon 明顯強於 Google 的上一代模型,並具備與 OpenAI 的 GPT-6 Astra 競爭的能力;但 Anthropic 的領先系統整體上似乎仍占優勢。

這次發布的亮點不在於單一基準測試的勝利,而在於它暴露出的取捨。Argon 提供 100 萬 token 的輸出上限,以及異常低的初期 token 價格;另一方面,獨立測試顯示,完成相同任務時,它消耗的 token 遠多於部分競爭對手。Google 也在收集安全性回饋的同時限制存取,因此開發者目前還無法透過廣泛提供的 API 評估該模型。

分階段推出,支援異常長的輸出

據 The Decoder 報導,Google 首先透過 Fairwind 計畫,向選定的「可信賴網路防禦者」以及內部團隊提供 Argon。據報導,初始版本在該測試環境中運作時沒有網路安全防護限制。Google 也參與美國政府的一項自願計畫,讓政府機構提前取得新模型。

公司計畫利用測試者回饋完善 Argon 的安全機制,再逐步向開發者、企業和消費者擴大存取權限。付費 API 客戶與 Google AI Ultra 訂閱者預計將先取得存取權,但 Google 尚未提供明確的公開日期。

這款模型最受矚目的能力是 100 萬 token 的輸出上限,高於前一代的 64,000 token。Argon 保留 100 萬 token 的上下文視窗,可接受文字、圖片、影片和音訊,但只能產生文字。Google 正在 Gemini API 中加入名為 Long Decode Continuation 的功能,可暫停長篇回應,並透過後續請求繼續生成,而不是讓冗長的推理程序因逾時而中止。

這項設計針對複雜的研究、程式編寫和代理型工作流程,在這些情境中,模型可能需要維持很長的推理鏈。它也為買家帶來一個實際問題:更高的輸出上限是否能在可接受的成本下帶來更好的結果,而不是單純產生更多文字?

獨立測試顯示進步,但沒有壓倒性優勢

目前最有力的效能證據來自 Artificial Analysis,The Decoder 對此作了報導。在該機構公布的最高推理設定下,Argon 在 Artificial Analysis Intelligence Index 中得到 53 分。這與 OpenAI 的 GPT-6 Astra 和 Anthropic 的 Claude Fable 5.1 並列,並領先 GPT-6.1 Sol 一分。Anthropic 的 Claude Opus 5.5 得分 58,Claude Sonnet 5.5 得分 56。

這相較於 Google 的 Gemini 3.1 Pro Preview 是重大進步;據報導,Argon 超出前者 23 分。不過,與一個 OpenAI 模型並列,不等同於在整個前沿領域取得明確領先。The Decoder 的評估顯示,Anthropic 在該指標上領先,而基準測試結果會因任務不同而有很大差異。

Argon 在部分代理型評測中表現特別出色。Artificial Analysis 報告稱,它在 AutomationBench-AA 中取得 77.5%,比 Claude Sonnet 5.5 高 6 個百分點。在 Terminal Bench 4 中,Argon 達到 57%,較 Gemini 3.1 Pro Preview 大幅提升,但低於 Claude Sonnet 5.5 的 64%、Claude Opus 5.5 的 60% 和 GPT-6 Astra 的 59%。

在 AA-Omniscience 測試中,該模型的幻覺率也低於比較中的系統,為 15%;GPT-6 Astra 為 51%,GPT-6.1 Sol 為 54%。然而,它在該測試中的準確率為 50%,低於 Gemini 3.1 Pro Preview 和 GPT-6 Astra。這項差異對企業應用很重要:拒絕猜測可以提高可靠性,但不代表系統知道得更多。

Google 自己的基準測試結果據報顯示,Argon 在許多類別中領先;Vals AI 也以 68.9% 的分數將它列為第一。這些說法與供應商相關,或基於選定的外部評測,不應被視為普遍排名。The Decoder 另指出,Vals 的結果把 Anthropic 的中階模型 Sonnet 5.5 排在旗艦 Opus 5.5 之上,因此應謹慎解讀該排名。

低 token 價格遇上高 token 消耗

Google 將 Argon 的推出價格定為每 100 萬個輸入 token 2 美元,以及每 100 萬個輸出 token 10 美元。預計標準價格將分別上調至 4 美元和 20 美元。快取輸入可享 95% 折扣;根據 The Decoder 報導的數字,初期快取輸入價格約為每 100 萬 token 10 美分。

對前沿模型而言,這些費率看起來很低,但 token 價格本身並不能決定應用程式成本。Artificial Analysis 報告稱,Argon 每項 Intelligence Index 任務平均使用 62,000 個輸出 token,而 GPT-6 Astra 使用 27,000 個。因此,促銷價格下 Argon 每項任務的估計成本為 1.99 美元,Astra 則為 3.26 美元。Argon 的標準價格生效後,同樣的計算將升至約 3.98 美元。

對開發者而言,含義很直接:Argon 可能適合能從長篇推理受益、且能承受額外輸出的工作負載;但若延遲、token 數量或可預測支出更重要,它就未必經濟。團隊需要衡量完整工作流程的成本,而不是只比較公開的每 token 價格。

模型在純粹推理以外的表現也不均衡。據報導,Arena.ai 在其 Text Arena 中將 Gemini 4 Argon 列為第一,其中包括程式編寫、遵循指令、困難提示詞和創意寫作。然而在 Code Arena 的 WebDev 測試中,它排名第八。這項差距再次凸顯,評估模型時應放在它實際運作的軟體堆疊、工具、檢索系統和使用者介面中進行。

接下來值得關注的事項

最直接的訊號將是 Google 公開 API 的發布,以及公司是否能維持初期價格,讓開發者有足夠時間測試生產環境的工作負載。付費 API 客戶和 Google AI Ultra 訂閱者預計可取得存取權,但目前尚未公布日期。

企業買家應關注延遲、輸出 token 使用量、拒答行為和工具使用可靠性的獨立測量結果。100 萬 token 的輸出上限只有在長篇回應能改善任務完成率,同時不造成失控成本或難以稽核的代理行為時,才真正具有意義。

更廣泛的競爭訊號將來自產品整合。The Decoder 報導稱,儘管 Argon 的基準測試結果強勁,Google 的 Gemini 應用程式仍落後於 Claude Cowork 和 ChatGPT Work 等產品。如果 Google 無法將模型與更優秀的代理介面、工具和工作流程控制結合,基準測試上的進步可能對採用率產生有限影響。

Creati.ai 的觀點

Gemini 4 Argon 看起來是可信的重返前沿,而非決定性的接管。它的進步很有意義:據報導,它縮小了與 OpenAI 的大部分差距,改善了 Google 在多項代理型測試中的弱勢結果,並提供有吸引力的初期價格。但 Anthropic 在 Intelligence Index 上較高的分數,以及 Argon 大量消耗 token,使成本效能的評估變得複雜。

對 AI 建構者而言,這次發布最好被理解為另一個需要針對工作負載進行測試的強大選項。本輪勝負不會由單一排行榜決定,而將取決於哪個模型能在真實使用者——而非只有選定測試者——取得存取權後,提供可靠結果、可控的推理成本、有用的工具執行能力和安全部署。

廣告