
Anthropic 已進一步說明其為 Claude 生成文字加上浮水印的計畫,描述這是一套旨在辨識 AI 撰寫內容、但不會在視覺上改變讀者所見回應的系統。該公司表示,透過正確的加密金鑰即可偵測到該浮水印,並計畫提供一個獨立的浮水印偵測 API。
這項澄清出現在 Anthropic 本週稍早表示 Claude 將採用浮水印,以符合歐盟 AI 法案透明度守則之後。此舉引發使用者間的討論,擔心雇主、學校或其他機構可能利用這項技術來辨識未揭露的 Claude 使用情況。
在週五發表的部落格文章中,Anthropic 表示 Claude 將採用由 Google DeepMind 開發、並於 2024 年提出的 SynthID-Text 方法。此方法依賴語言模型在多個字詞或片語都同樣合適時所做出的選擇。例如,模型可能有多種合理方式來描述天氣。整段回應中,這些選擇可形成一種一般讀者不易察覺、但持有對應偵測金鑰者可加以檢查的統計模式。
Anthropic 表示,浮水印不應影響 Claude 輸出的品質。該公司將帶有浮水印的回應描述為對讀者而言與未加浮水印的回應無法區分,這意味著使用者在一般寫作或程式撰寫工作流程中不太可能察覺到這套系統。
計畫中的偵測 API 可能比浮水印本身更重要。若依照說明推出,它將讓開發者、出版商、教育工作者與企業管理者能把驗證功能整合進自己的系統,而不必完全依賴通用型 AI 偵測工具。
Anthropic 承認,浮水印並不會在文字的所有可能版本中永久存在。該公司表示,輕度編輯可能不會完全移除浮水印,但若是將每個字都替換掉的全面改寫,則會將其消除。這種區別使該系統更適合用來辨識實質上保留 Claude 內容的輸出,而不是用來證明最終文件與某個模型有任何關聯。
結果也可能取決於 Claude 被當作編輯工具時的使用方式。若模型只是校對一段人類撰寫的文字,Anthropic 表示可供浮水印附著的文字可能很少,因為大多數字詞來自原作者。偵測結果將取決於該段文字的長度,以及 Claude 對其修改的幅度。
這項限制對於建立合規或來源追蹤流程的產品團隊很重要。浮水印檢測結果為陽性,可能表示 Claude 生成或大幅修改了內容,但未必能證明基礎想法由誰撰寫、文字有多少部分來自某個人,或最終版本是否後來又在其他地方被重寫。
Anthropic 預期,浮水印在程式碼中的效果會比一般散文更弱。功能性軟體通常讓模型在可互換的字詞或結構之間可選擇的自由度較低,因此可供浮水印模式使用的任意性決策更少。
該公司表示,若程式碼包含較具彈性的語言選擇,特別是註解,仍可能出現某些可偵測訊號。它將對可執行程式碼的影響形容為依定義幾乎可忽略,暗示浮水印主要是作為來源追蹤機制,而不是對 程式碼生成 的限制。
對工程組織而言,這樣的區別可能使浮水印對文件、註解、提交訊息與生成說明,比對程式的功能行為更有關聯。這也意味著,對較短片段或高度受限的程式碼而言,偵測結果可能不如較長的自然語言回應可靠。
目前的細節來自 Anthropic 對其預計實作方式的說明。該公司關於輸出品質不變、對輕度編輯具韌性以及對程式碼影響有限的說法,屬於供應商主張;原始資料並未提供獨立測試結果、偵測準確率、偽陽性率,或浮水印偵測 API 的發布日期。
技術基礎並非 Anthropic 獨有。Anthropic 指出,Google DeepMind 的浮水印方法 SynthID-Text 就是它打算採用的方式。該公司也表示,其他主要模型開發者都簽署了同一份行為準則,並計畫實作自己的浮水印,但來源並未點名這些開發者,也未說明其系統是否能彼此互通。
這與那些檢視文風訊號或重複寫作模式的 AI 偵測產品不同。Anthropic 特別將浮水印驗證與 Pangram 這類試圖從文字特徵推斷 AI 使用的服務區分開來。浮水印檢查是在尋找模型產生的訊號;基於風格的偵測器則是從文字本身作出機率性判斷。
使用者的反對也替這項推廣增加了市場與政策層面的意義。TechCrunch 報導,Reddit 上的使用者批評了這項做法,而 Business Insider 則報導,X 上有數十人聲稱已取消 Claude 訂閱。這些反應屬於報導中的使用者說法,並非 Anthropic 客戶群出現可量測變化的證據。
對 AI 開發者而言,這項宣布顯示,來源追蹤將成為 API 層級的功能,而非獨立的審查或偵測層。生成報告、行銷文案、客服回覆或內部文件的應用程式,最終可能能夠在其產出內容中附加機器可讀的驗證資訊。
企業買家則需要判斷浮水印究竟能合法證明什麼。它或許有助於辨識仍接近 Claude 輸出的內容,但無法解決混合作者、經過大幅編輯的文件,或透過多種工具複製而來的材料。若組織要在聘用、教育或合規決策中使用浮水印,就必須為不確定結果與可能的偽陰性建立政策。
這種做法也帶來部署上的取捨。浮水印可以在不於每則回應顯示可見標籤的情況下支援透明度要求,但驗證仍取決於能否存取正確的偵測系統。在 Anthropic 發布 API 並完成獨立評估之前,開發者無法評估其延遲、成本、可靠性或與第三方內容管理系統的相容性。
第一個訊號會是 Anthropic 發布浮水印偵測 API,包括其文件、存取控制、定價與支援的內容類型。之後,獨立測試應檢驗短篇與長篇回應、改寫、翻譯、校對與對抗式重寫的偵測率。
開發者也應留意 Anthropic 是否會發布針對人類與 AI 混合文字的政策指引,以及它將如何處理程式碼、註解與文件。另一個未解問題是,不同模型供應商的浮水印能否被一致辨識,還是會各自鎖定在各家公司自己的實作中。
最後,歐盟的透明度守則及其實際執行方式,將決定浮水印是成為主要模型供應商的基本要求,還是更廣泛揭露系統中的其中一環。
Anthropic 的澄清讓 Claude 的浮水印看起來不再像是可見標籤,而更像是一種隱藏的來源訊號。這對大規模驗證可能有幫助,但前提是偵測工具必須準確、可取得,且被解讀為模型參與的證據,而不是作者歸屬的最終證明。
最具決定性的測試會在 API 上線後出現。在獨立結果顯示浮水印在一般編輯與真實生產工作流程中的表現之前,企業應把它視為一項正在發展中的治理訊號,而不是獨立的合規裁決。
Anthropic 正在說明 Claude 的浮水印如何辨識 AI 撰寫文字、哪些編輯可能使其失效,以及開發者應該期待什麼。