Anthropic 推出 Opus 5.5,具備更低的 token 價格、更快的輸出,以及宣稱達到 Fable 級的結果,將高效率企業 AI 的門檻再度拉高。

Anthropic 已推出 Claude Opus 5.5,這是一款新的旗艦模型;公司表示,它在許多任務上可與其更強大的 Fable 5.1 系統相匹敵甚至超越,而且運行成本更低。這次發表讓開發者在 AI 採購者權衡能力與推理成本之際,獲得一款更快、更便宜的高階模型。
Opus 5.5 目前已可透過 Anthropic 的服務與主要雲端平台立即使用。公司也表示已改善模型的寫作風格,減少術語並將重要資訊更早放在回應中。這些改動針對的是先前 Claude 模型常被批評的:輸出過於公式化或過度繁複。
Anthropic 將 Opus 5.5 定價為每百萬輸入 token 4 美元、每百萬輸出 token 20 美元,低於 Opus 5 的 5 美元與 25 美元。公司也表示,快取讀取成本下降了 60%。TechCrunch 報導的輸出價格則是從每百萬 token 25 美元降至 20 美元,並指出新模型在提供服務時所需的算力更少。
Anthropic 估計,若將 token 使用量納入考量,總體營運成本應比 Opus 5 低約 40%。這項更廣泛的估計反映了模型據稱能使用更少 token 的能力,以及輸出速度提升超過 30%。這個區別對生產團隊很重要:如果模型在困難任務上使用了大幅更多的 token,較低的標價並不會自動保證帳單也更低。
根據 The Decoder 對 Anthropic 公告的報導,訂閱者的五小時使用上限將提高 20%。Anthropic 表示,更高的上限與更低的使用成本結合後,應可使實際可用容量擴大約 25%。
該模型可在 Claude Platform 上以模型 ID claude-opus-5-5 使用,也可透過 Amazon Web Services、Google Cloud 與 Microsoft Azure 存取。這樣的分發讓企業團隊在將模型整合進既有的雲端、合規與採購系統時,有更多選擇。
Anthropic 將 Opus 5.5 描述為其迄今表現最佳的模型,並表示它在多數任務上與 Claude Fable 5.1 相當。其比較結果也把這款新模型在多項評測中放在 OpenAI 的 GPT-6 Astra 之前,儘管標價更低。這些都是供應商自行聲稱的結果,不應被視為對普遍優勢的獨立證實。
The Decoder 更詳細地報導了 Anthropic 的程式碼比較。在 FrontierCode 上,公司表示 Opus 5.5 以約 20% 的每任務成本擊敗 GPT-6 Astra。在 Terminal-Bench 4.0 上,Anthropic 宣稱它以 Astra 成本的 40% 達到相近表現,而在 CursorBench 上則以三分之一的成本比 GPT-5.6 Sol 高出 11 分。
外部也有部分證據支持該模型的基準地位。The Decoder 引用的獨立平台 Artificial Analysis,在最大努力設定下給予 Opus 5.5 的 Intelligence Index 分數為 58,這是報導當時該指標上的最高分。它也回報在十項評測中的六項領先,包括 Humanity’s Last Exam 與 SciCode。
然而,同一份分析也指出了效率上的取捨。在最大努力下,Opus 5.5 據稱每個任務產生約 119,000 個輸出 token,相較之下 Opus 5 為 73,000、Fable 5.1 為 78,000、GPT-6 Astra 為 27,000。在某些工作負載中,較低的 token 單價可以抵銷這種用量,但對每一個單獨任務來說,模型不一定都更便宜。
Anthropic 表示,Opus 5.5 較不容易使用術語、較常先講最重要的資訊,且更能遵循寫作指示。The Decoder 描述的早期測試者認為輸出更清楚,但這些印象仍然有限,不能取代在真實工作流程上進行受控評估。
此次發布也擴大了套用於 Anthropic 最高能力模型的安全控制。Opus 5.5 會獲得與 Fable 5.1 相當的資安、生物學與前沿 AI 開發防護措施。Anthropic 表示,觸發這些控制的請求可能會被路由到其他模型。據報導,大多數被標記的資安工作會導向 Opus 4.8,而某些生物學與前沿開發請求則會送往 Opus 5。
已驗證的組織可透過 Anthropic 的 Life Sciences Verification Program 申請生物研究存取。公司也計畫將其 Cyber Verification Program 擴展至 Opus 5.5。該模型還包含「Preserved Thinking」,限制 API 使用者修改先前上下文以萃取推理,並加入據稱有助於符合 EU AI Act 的浮水印措施。
Anthropic 表示,Opus 5.5 在發布前曾由 METR 與 Frontier Design 進行評估。公司也正準備對強化學習環境進行更嚴格的篩選、更強的監控,以及自動化的安全訓練情境。這些計畫很重要,但它們描述的是進行中的工作,而不是證明所有對齊或濫用風險都已解決。
對軟體團隊而言,主要機會不只是取得更高的基準分數。一款結合強大程式碼與知識工作表現、且標價更低的模型,可能讓長時間運行的AI 代理更實用,尤其適合程式碼審查、除錯、文件撰寫、研究與內部分析。
成本情況將高度取決於努力程度設定、提示設計、上下文重用與輸出長度。Artificial Analysis 的數據顯示,最大努力版的 Opus 5.5 可能消耗比競爭系統多得多的 token。因此,團隊應該測試每個完成工作流程的成本,而不是只比較 token 價格。
對企業買家來說,Claude Platform、Amazon Web Services、Google Cloud 與 Microsoft Azure 的可用性,可能降低部署摩擦。但買家仍需驗證延遲、資料保留選項、在防護機制啟動時的路由行為,以及模型在自家文件與工具上的可靠性。Anthropic 關於更清晰寫作的說法,對長時間工作會話可能很重要,但應與既有模型比較測量,而不是直接假定成立。
Anthropic 的發布也加劇了高階模型之間的競爭。公司正將 Opus 5.5 定位在對抗 Fable 5.1 與 GPT-6 Astra,同時回應更便宜的替代方案,包括 The Decoder 所描述、以更低價格提供更低效能的中國模型。下一階段的競爭,可能不只由標題性的基準領先決定,也會由每個成功任務的成本與部署控制共同決定。
最即時的訊號,是獨立評測是否能重現 Anthropic 報告的程式碼、代理式工作與商務任務改進。實際客戶成本也將是另一個重要測試,尤其是那些會產生大量輸出的最大努力工作負載。
Anthropic 表示,Sonnet 5.5 與 Haiku 5.5 將在接下來幾週內推出,並在效能、效率與安全性上帶來類似改進。它們的定價與能力將顯示 Opus 的變化是更廣泛的系列重設,還是主要只是旗艦升級。
開發者也應關注 Cyber Verification Program 的推進、在安全控制下的模型路由變化,以及 Anthropic 在監控與反蒸餾措施方面的更多細節。這些政策可能會影響哪些研究與安全工作流程可直接在 Opus 5.5 上執行。
Opus 5.5 之所以重要,是因為 Anthropic 把效率賣成能力的一部分,而不是與能力相對立的妥協。公司的報告結果顯示,高階 AI 產品正朝向更實用的衡量方式前進:完成整個工作流程的成本與可靠性。
這些證據令人鼓舞,但仍高度受 Anthropic 自家基準與測試選擇影響。對開發者與買家而言,合理的做法是進行有針對性的評估:在具代表性的工作上,衡量成功完成任務、token 消耗、延遲、安全路由,以及是否需要人工編修,之後再把所謂營運成本降低 40% 當作生產環境中的事實。