Sony Music 與 Warner 出版商因涉嫌盜版與未經授權的 AI 訓練起訴 Anthropic,擴大了圍繞 Claude 與資料來源的著作權風險。

Sony Music Publishing、Warner Chappell 以及其他音樂出版商已向聯邦法院起訴 Anthropic 及其高階主管,指控這家 AI 公司非法取得並使用受著作權保護的歌曲、歌詞與樂譜來開發 Claude。該訴狀將爭議不只是界定為受著作權保護的內容是否可用於 AI 訓練,而是 Anthropic 據稱如何取得這些內容。
此案已向美國加州北區聯邦地方法院提起,將 Anthropic、執行長 Dario Amodei 與共同創辦人 Benjamin Mann 列為被告。出版商指控該公司在未經許可下,透過 torrent、爬取與下載取得大量受保護作品。Anthropic 向 TechCrunch 表示不同意這些指控,並打算為自己辯護。
這起訴訟為 Anthropic 已經相當嚴重的法律問題,再添一道來自音樂產業的重大挑戰。根據 TechCrunch 與 The Decoder 的報導,原告指稱在 Claude 模型的開發過程中使用了數萬件音樂作品,主要是歌詞形式,另包括樂譜與相關作品。
出版商以極其嚴厲的措辭描述所稱行為,將其定性為大規模且持續進行的智慧財產竊取。這些描述是訴狀中的指控,並非法院的認定。
此案延續 Anthropic 先前與作者及出版商在 Bartz v. Anthropic 中的爭議。在該案中,法院認定透過盜版取得受著作權保護的書籍屬違法後,該公司同意支付 15 億美元;但對於將受著作權保護內容用於訓練的另一項獨立問題,則採取不同處理。TechCrunch 報導法院命令支付;The Decoder 則將其描述為和解。
這項區別是新案的核心。音樂出版商試圖在先前裁決基礎上主張,未經授權的取得本身就能單獨構成責任,而不論相關檔案之後是否直接納入商業模型。
該訴狀據稱聚焦於 Anthropic 使用 torrent 網路與所謂的盜版資料庫,包括 LibGen 與 PiLiMi。The Decoder 報導,出版商聲稱 Anthropic 至少從這些來源以 torrent 取得 700 萬本書,其中包括含有歌詞與音樂素材的書籍。這些書籍是否被直接用於商業 Claude 模型,預計將在證據開示中成為重大議題。
原告也據稱挑戰 Anthropic 從 MusixMatch 與 LyricFind 等授權服務蒐集歌詞的行為,認為該爬取違反平台條款與出版商權利。訴狀中提及的其他資料集包括 Books3、The Pile 與 Common Crawl,出版商主張其中含有未經授權的素材。
指控不僅限於數位檔案。The Decoder 報導,訴狀指控 Anthropic 掃描並銷毀二手歌曲集與樂譜收藏。訴狀還聲稱,一個以來自 LibGen 與 PiLiMi 的資料訓練的非商業模型,產生了之後用於商業 Claude 模型開發或回饋流程的合成資料。
Anthropic 先前曾否認直接使用來自 LibGen 與 PiLiMi 的書籍來訓練商業產品。根據 The Decoder,出版商的論點是,這類否認可能取決於 Anthropic 對「訓練」的定義,且未必能處理衍生資料或合成資料的使用。
目前最有力的事實是,出版商已提起此案,Anthropic 與其高層被列為被告,且 Anthropic 已拒絕相關指控。關於 torrent、資料集、模型開發路徑與高層指示的更細節主張,來自 TechCrunch 與 The Decoder 所報導的原告訴狀;這些主張仍具爭議。
The Decoder 報導,訴狀請求每項侵權作品最高 15 萬美元,另就移除著作權管理資訊(如通知或識別元資料)的每項違規請求最高 2.5 萬美元。最終風險將取決於哪些請求得以成立、被認定涵蓋多少作品,以及法院是否接受出版商的責任理論。
此案也對 AI 公司提出艱難的證據問題:當受保護內容經過預訓練資料集、合成資料管線、評估系統或強化流程時,何者算是對受保護內容的使用?公司可以區分來源檔案與後續模型,而權利人則可能主張,每個階段都反映了最初未經授權的取得或重製。
The Decoder 引述的 2025 年 11 月慕尼黑地方法院判決提供了一個國際參考點。該法院認定,受保護歌詞可算作模型參數中的重製,而生成的歌詞輸出可能構成非法公開揭露。此判決並非美國案件的裁定,但顯示法院正同時檢視模型內部與生成內容。
對模型開發者而言,這起訴訟加大了對資料來源進行更細緻記錄的壓力,不能只停留在資料集名稱。團隊可能需要留存紀錄,顯示檔案來源、適用哪些授權、如何解讀服務條款,以及受限制素材是否進入合成資料或強化學習管線。
對企業買家而言,這場爭議為供應商盡職調查又增加一層。關於模型著作權政策的問題,如今不僅包括是否會重現歌詞或書籍,也包括供應商能否證明學習資料的合法取得與治理。合約賠償、稽核權、模型版本控制,以及對高風險輸出的限制,可能在採購上變得更重要。
此案也可能影響 AI 訓練 的經濟模式。如果法院將盜版取得視為獨立的責任來源,企業在資料進入訓練流程之前,可能必須花更多成本在授權語料、過濾、來源系統與法律審查上。這不會解決所有著作權問題,但可能讓資料來源成為基礎模型供應商之間更顯眼的競爭因素。
第一個訊號將來自 Anthropic 的正式回應,以及任何挑戰訴狀的動議。證據開示應能顯示,所稱檔案是否進入 Claude 的商業訓練管線、是否透過合成資料間接使用,或是被保留作其他開發用途。
開發者應關注法院對高層責任、將 torrenting 視為獨立侵權的處理,以及出版商能否將特定作品連結到特定模型或訓練階段。AI 公司與音樂權利人之間的授權協議,也將顯示此訴訟是否正推動市場走向協商式存取。
本案與 Bartz v. Anthropic 的互動尤其重要。如果先前裁決成為針對取得方式責任的基礎,其他權利人可能會對其資料集中含有爭議素材的模型開發者提出類似主張。
這起訴訟將焦點從 AI 模型「產出什麼」這個熟悉問題,轉向組裝其訓練資料的、較不顯眼的系統。對 Anthropic 而言,法律風險可能不僅取決於 Claude 的提示層行為,也取決於採購、爬取管控與內部資料來源追蹤。
對更廣泛市場而言,實務教訓雖較窄卻很重要:如果法院檢視中間模型、合成資料與回饋管線,那麼「不是直接訓練於」可能不足以作為合規答案。若 AI 公司能證明資料從何而來,以及當權利不明確時他們做了什麼,隨著著作權訴訟更深入模型開發基礎設施,他們將更具優勢。