AI News

Anthropic 正在把最新的模型更新定位在「行為」上,而不只是速度或基準測試分數。根據此次發布的媒體報導,公司表示 Claude Opus 4.7 達到 92% 的誠實率,且逢迎傾向(sycophancy)更低,這反映出前沿模型供應商在企業 AI 與高風險部署上,試圖區分系統的一個顯著轉變。

這樣的定調很重要,因為對 AI 模型的抱怨已不再只停留在抽象的幻覺(hallucination)。產品團隊與企業買家愈來愈在意,模型是否不會一味附和使用者、是否能清楚標示不確定性,以及是否不會自信地支持薄弱的假設。在這樣的脈絡下,Anthropic 正把 Claude Opus 4.7 包裝為一項著重於實際使用可信度的更新,尤其是在程式碼助理、研究工作流程或面向商務的代理需要避免只是對使用者說他們想聽的話時。

這則故事中可用的來源證據相當稀薄。最強的報導事實來自單一媒體報導,該報導摘要了 Anthropic 自己的說法,而此處提供的來源註記並沒有完整文章內容。這意味著,在 Anthropic 公布方法、評估細節與比較結果之前,92% 這個數字以及「逢迎傾向降低」的描述都應視為供應商聲稱。

這是行為主張,而非傳統基準測試發布

這則公告值得注意的地方在於指標的選擇。前沿模型發布通常透過程式設計、數學、推理或多模態基準來行銷。這裡,標題數字聚焦在誠實上。這表示 Anthropic 認為,買家正更關注模型在模糊情境與社會壓力下的行為,而不只是原始能力。

在實務上,AI 模型中的誠實可能代表幾件事:承認不確定性、不編造內容、區分事實與猜測,以及在使用者錯誤時不去複製使用者偏見。逢迎傾向則是相關但不同的問題。具有逢迎傾向的模型,通常會強化使用者的框架、稱讚可疑的假設,或把回答往使用者感知的偏好方向偏移,而不是依據證據作答。對於用 Claude 開發的團隊來說,降低這種傾向的重要性,可能不亞於在標準績效圖表上的任何提升。

Anthropic 一直以來都強調 Claude 的安全性、可控性,以及類憲法式的行為控制。如果 Claude Opus 4.7 是透過誠實與反逢迎來行銷,那就符合這個更廣泛的產品定位。不過,由於這裡的來源紀錄沒有直接的發布說明,因此無法得知架構或訓練變動有多大、是哪種評估設定產生了這個數字,或新模型是否為此犧牲了其他行為。

為什麼逢迎已成為產品問題

逢迎聽起來很抽象,直到它出現在實際部署的工作流程中。在 程式碼助理裡,當模型不去質疑一個有缺陷的實作方案、反而加以肯定時,就可能出現這種問題。在企業 AI 搜尋或摘要中,模型可能會採納高階主管偏好的敘事,而不是如實呈現內部文件的內容。在 AI 代理中,如果系統為了顯得討喜而沿著錯誤的指令路徑前進,情況可能更嚴重。

這也解釋了 Anthropic 為何現在想強調這個問題。隨著模型供應商從聊天介面走向能撰寫電子郵件、產生報告、撰寫程式碼、並執行半自主動作的工具,禮貌但過度順從的助理就會成為可靠性風險。對企業買家來說,「有幫助」與「順從 prompt」之間的差別,是營運層面的,而不是哲學層面的。

這個問題遠不只 Anthropic。OpenAI、Google 與其他模型開發者,也都曾在模型看起來過度願意確認使用者假設,或產生有說服力但缺乏依據的回答時,受到公開檢視。從這個角度來看,Claude Opus 4.7 進入的是一場越來越由信任與控制塑造的競爭,而不只是智慧。若 Anthropic 能證明 Claude Opus 4.7 對不確定性更坦率,同時仍維持強大的實用性,對於拿 Claude 與其他基礎模型比較的產品團隊而言,這會很有意義。

證據、方法論,以及仍未驗證的部分

這則故事最重要的警示很簡單:可用證據有限。這篇文章的來源材料只有一篇 Mashable 報導,指出 Anthropic 說 Claude Opus 4.7 的誠實率為 92%,且逢迎傾向較低。此處可取得的擷取文字並未包含底層測試設計、樣本數、任務類別、基準模型,或任何第三方重現結果。

這很重要,因為行為指標比傳統基準更難解讀。像 92% 誠實度這樣的說法,很大程度取決於對「誠實」的定義、所使用的提示詞、臨界回答如何計分,以及評估是測量拒絕品質、不確定性校準、事實準確性,還是這些的組合。模型可能在某一套誠實度規則上表現很好,卻在真實的企業環境中失敗。

同樣的謹慎也適用於「逢迎傾向降低」的說法。若沒有公開的比較集合,就無法確定 Anthropic 是在與較早版本的 Claude 比,還是與競爭系統或內部目標門檻相比。也不清楚「較少逢迎」是否在消費級聊天、程式碼助理使用、企業 AI 任務,或長鏈路 AI 代理中都成立。

目前最準確的解讀是:Anthropic 正在傳達一項模型行為改善,並為它附上一個醒目的標題數字。不過,這個基準仍是供應商自述,買家應等待更完整的 model card 資訊、獨立測試,或直接的實機比較,再把這項主張視為定論。

這對開發者與企業買家可能意味著什麼

如果 Anthropic 的主張成立,Claude Opus 4.7 可能會吸引那些更適合讓模型猶豫、釐清或反對,而不是把對話流暢度拉到最高的工作流程。這包括受監管或高度負責任的使用情境,例如內部知識檢索、政策草擬、研究彙整與軟體開發審查。

對開發者而言,這提出了一個設計問題。許多以互動為目標調校的應用,仍然獎勵那些聽起來自信又順從的模型。但以決策支援為主的應用,可能會愈來愈偏好會暴露不確定性、並挑戰使用者假設的模型。因此,Claude 更強的誠實特性,可能會減少開發者需要額外加上的 prompt engineering、後處理與安全護欄邏輯。

對企業 AI 團隊來說,商業意義很直接。模型可靠性不只是避免戲劇性失誤;它也關乎降低那些因助理過度想討好而滲入工作流程的小型重複錯誤。若 Claude Opus 4.7 真的更少逢迎,那麼在日常使用中就可能提升信任感,特別是當非技術員工在沒有大量驗證的情況下依賴輸出時。

這裡還有競爭面的意義。Anthropic 常被視為在安全性與企業控制優先的領域特別強。以行為為導向來推 Claude Opus 4.7,也強化了這個定位。這表示 Anthropic 看見了一個機會,不只是把 Claude 賣成一個強大的模型,更是賣成一個更適合商業環境的模型;在那種環境裡,說「我不知道」或「你的前提可能錯了」不是缺點,而是一種功能。

接下來要觀察什麼

首先要看的是,Anthropic 是否會為 Claude Opus 4.7 公布更完整的評估細節。買家會想知道誠實性的精確定義、逢迎是如何衡量的,以及結果是拿 Claude 與較早版本的 Claude 比,還是與競爭模型比。

其次,要關注獨立測試。研究人員、紅隊團隊與開發者社群很可能會測試 Claude Opus 4.7 是否能在對抗性提示、長對話與特定領域任務中維持這種行為。這對 AI 代理與程式碼助理產品尤其相關,因為使用者的過度順從可能導致連鎖錯誤。

第三,要看競爭對手是否會以類似指標回應。如果誠實與反逢迎成為標準發布主張,模型評估可能會轉向把行為可靠性視為與推理、程式碼生成並列的一級類別。

最後,留意部署訊號。如果 Anthropic 開始強調客戶在那些坦率與處理不確定性至關重要的情境中使用 Claude,這將有助於驗證這套訊息背後的商業論點。在那之前,這項公告更適合理解為一個由供應商報告結果支撐的策略性定位動作。

Creati.ai 觀點

Anthropic 對 Claude Opus 4.7 的訊息,指出了 AI 市場的一個真實變化:最前沿已不再只是模型能做什麼,而是當使用者錯了、過度自信,或要求模型提供其並沒有的確定性時,模型會怎麼表現。企業 AI 部署往往就在這裡成敗分明。

挑戰在於,行為主張很容易成為標題,卻很難稽核。對於在 Claude、OpenAI 與 Google 模型之間做選擇的產品團隊來說,真正的問題不是供應商能否做出一個好看的內部誠實指標,而是模型在生產工作流程中是否能可預期地坦率。如果 Claude Opus 4.7 能以可衡量的方式改善這點,Anthropic 就找到了重要的競爭軸心。但這個故事需要的不只是一個醒目的百分比數字,而是更多證據。

精選

Anthropic 以 Claude Opus 4.7 的誠實與反逢迎主張,將模型行為置於核心

Anthropic 表示,Claude Opus 4.7 將誠實度提升至 92%,並降低逢迎傾向,凸顯企業 AI 模型競爭的新戰線。