
即使有一項重要的法院判決認定某公司模型訓練屬於合法,以受版權保護的書籍訓練 AI 模型的合法性仍未明朗。TechCrunch 對近期版權訴訟的分析發現,決定性的問題可能不是開發者是否使用了受保護作品,而是他們如何取得這些作品,以及他們的 AI 產品是否與原始市場競爭。
這種不確定性影響到打造 ChatGPT、Gemini 和 Claude 等系統的公司,以及作者、出版社、企業買家與將生成式 AI 整合進產品的開發者。法院正在套用早在大規模機器學習出現數十年前制定的版權規則,因而產生一些早期判決,可能影響整個產業,卻仍未解決更廣泛的爭議。
最具影響力的案件之一涉及 Anthropic 以及一群其著作被用於訓練該公司 AI 模型的作家。根據 TechCrunch,William Alsup 法官裁定 Anthropic 的 AI 訓練屬於合法,但因為該公司從未經授權的線上「影子圖書館」取得部分書籍,命令其支付 15 億美元的版權和解金。
這項區分至關重要。該判決把將受版權保護作品納入語言模型訓練,視為更接近閱讀文學並從中學習,而非為了散布而複製一本書。裁罰則著重在據稱非法取得訓練材料這一點。
專精於智慧財產、版權與科技的律師 Cathy Gellis 告訴 TechCrunch,這種推理可能對 AI 公司有利,因為版權法一般關注的是複製,而不只是使用或體驗一個作品。不過,金錢後果以及判決對資料來源的處理,仍然讓模型開發者面臨相當大的風險。
此外,這起案件也不能保證其他法院會得出相同結論。Anthropic 判決在更大範圍的待決訴訟中,仍只是具有影響力的初步裁定。
許多法律爭論圍繞著合理使用展開。這是一項可在批評、教育、戲仿或其他具轉化性的活動中,允許未經授權使用受版權保護材料的原則。法院通常會檢視使用目的、所涉及材料的數量,以及其對原作品市場的影響。
TechCrunch 引述的智慧財產律師 Jason Henderson 表示,當公司以受版權保護的材料訓練,進而建立一個直接與來源材料競爭的產品時,法院似乎尤其關切。這種疑慮塑造了另一宗涉及 Thomson Reuters 與 Ross Intelligence 的案件;Ross Intelligence 是一家法律研究公司,使用 Reuters 內容開發一個競爭性的 AI 平台。
在那場爭議中,Stephanos Bibas 法官認定 Ross 的使用不具轉化性,因為它與 Thomson Reuters 的產品缺乏足夠不同的目的或性質。這項判決對 AI 公司是一個警訊:訓練資料與模型輸出,可能因最終系統是否取代原市場而受到不同對待。
這種邏輯對主張聊天機器人可產生合成書籍、摘要或其他與其作品競爭內容的出版商與作者,可能變得非常重要。TechCrunch 報導指出,這類主張至今尚未在法庭上勝出,因此其最終力道仍不確定。
目前可得的證據,無法為所有AI 訓練建立單一法律規則。Anthropic 判決支持訓練本身可能構成合法使用的可能性,而 Ross Intelligence 案則顯示,若產品直接競爭,合理使用抗辯可能被削弱。關於資料來源、產品目的、輸出行為與市場影響的不同事實,可能導致不同結果。
這兩起案件也都比整個產業層面的問題更狹窄。針對從非法來源取得的書籍所作的判決,未必能解決透過授權資料庫、網路爬取或其他存取方式取得的書籍之地位。同樣地,針對法律研究產品的裁定,也未必能直接套用到通用型聊天機器人。
Gellis 告訴 TechCrunch,初步判決正在形塑企業行為,但隨著訴訟進展,之後可能被推翻或限制。多數大型 AI 公司仍捲入待決的版權爭議,因此目前的判決應視為訊號,而非法律的最終定論。
該文也區分了訓練爭議與 AI 生成作品的版權問題。在 Thaler v. Perlmutter 一案中,法院認定完全由 AI 生成的作品不具版權保護資格。這項獨立規則引發實務問題:要有多少人類貢獻才足以受保護,以及要如何驗證一件作品是由 AI 創作或由 AI 協助完成。
對模型開發者來說,資料來源正從後端法律細節,變成產品與風險管理問題。Anthropic 案顯示,即使模型訓練理論本身通過司法審查,從未經授權的儲存庫取得訓練材料,仍可能造成責任。因此,公司可能面臨壓力,必須記錄書籍與其他受保護作品的來源、處理方式,以及未來資料進入流程由何種控制機制管理。
產品團隊也需要評估其系統是定位為通用工具,還是特定內容市場的替代品。Ross Intelligence 的判決指出,與既有資訊服務直接競爭的、鎖定範圍較窄的 AI 產品,可能面臨不同於更廣泛、更具轉化性系統的合理使用分析。
企業買家應預期版權保證仍將帶有條件。供應商可以說明其資料實務與賠償政策,但在法院仍持續判斷訓練、檢索、輸出生成與市場替代是否應分開分析時,任何合約都無法消除不確定性。
研究人員與創辦人也面臨類似取捨。使用高品質的受版權保護材料可以改善系統,但這些資料的法律價值取決於取得方式與預期用途。在更多案件成熟之前,保守的資料治理與清楚的紀錄,可能與模型表現同樣重要。
最重要的訊號將來自仍在進行中的 AI 相關版權案件後續裁決,尤其是處理透過合法管道而非影子圖書館取得書籍的判決。法院如何看待那些與作者作品相似或競爭的聊天機器人輸出,也將釐清市場損害如何被評估。
建構者應關注有關授權訓練資料、退出機制、集體授權,以及證明哪些資料進入模型所使用的證據標準,更明確的規則。另一個關鍵問題是,上訴法院是否會維持 Anthropic 爭議中所確立的合法訓練與非法取得之間的區別。
業界也應追蹤法院如何將版權保護標準套用到 AI 輔助作品。人類作者與機器協助之間的界線,將影響出版社、軟體公司,以及依賴生成工具創作商業內容的使用者。
眼前的教訓不是 AI 用受版權保護的書籍訓練究竟合法或非法,而是合法性取決於一連串事實:材料如何取得、模型或產品如何使用它、是否與來源市場競爭,以及結果中有多少人類作者性可被辨識。
對 AI 公司而言,最安全的做法是把法律不確定性視為營運限制。具備文件紀錄的資料來源、按產品區分的市場分析,以及可調整的訓練策略,會比假設一項有利判決就能定案更為穩健。法院正在開始界定邊界,但尚未畫出穩定的分界線。
TechCrunch 的法律分析指出,以受版權保護的書籍進行 AI 訓練仍未定論,而合理使用判決為模型開發者帶來風險。