Sony Music과 Warner 출판사, Claude 학습에 쓰인 것으로 alleged된 해적판 행위로 Anthropic 고소

Sony Music과 Warner 출판사는 해적판 의혹과 무단 AI 학습을 이유로 Anthropic를 고소하며 Claude와 데이터 출처를 둘러싼 저작권 위험을 확대했다.

AI News

Sony Music Publishing, Warner Chappell 및 기타 음악 출판사들은 AI 기업 Anthropic와 그 고위 경영진을 연방 법원에 고소하며, 해당 회사가 Claude를 개발하기 위해 저작권으로 보호되는 노래, 가사, 악보를 불법적으로 입수하고 사용했다고 주장했다. 이 소장은 분쟁을 단순히 저작권 자료를 AI 학습에 사용할 수 있는지의 문제로만 보지 않고, Anthropic가 이를 어떻게 취득했는지도 문제 삼고 있다.

캘리포니아 북부 연방지방법원에 제기된 이 사건은 Anthropic, CEO Dario Amodei, 공동창업자 Benjamin Mann을 피고로 적시했다. 출판사들은 회사가 허가 없이 대량의 보호 저작물을 토렌트, 스크래핑, 다운로드했다고 비난한다. Anthropic는 TechCrunch에 자신들은 주장에 동의하지 않으며 방어할 계획이라고 밝혔다.

Anthropic에 닥친 새로운 저작권 분쟁

이번 소송은 이미 상당한 법적 문제를 안고 있는 Anthropic에 음악 산업의 큰 도전을 더한다. TechCrunch와 The Decoder의 보도에 따르면, 원고들은 수만 건의 음악 작곡물이 Claude 모델 개발에 사용되었다고 주장하며, 주로 노래 가사 형태였고 악보와 관련 작품도 포함됐다고 한다.

출판사들은 이 행위를 매우 심각한 표현으로 묘사하며, 대규모이자 지속적인 지적재산권 도용이라고 규정한다. 이러한 표현은 법원의 판단이 아니라 소장에 담긴 주장이다.

이번 조치는 Anthropic가 이전에 작가와 출판사들과 벌인 Bartz v. Anthropic 사건에 이어진 것이다. 그 사건에서 회사는 법원이 저작권이 있는 책을 해적 행위로 취득한 것은 불법이라고 판단한 뒤 15억 달러를 지급하기로 합의했지만, 학습을 위해 저작권 자료를 사용하는 별도 쟁점은 다르게 다뤄졌다. TechCrunch는 법원이 지급을 명령했다고 보도했고, The Decoder는 이를 합의로 설명했다.

이 구분은 새 사건의 핵심이다. 음악 출판사들은 무단 취득이 이후 파일이 상업 모델에 직접 포함됐는지와 무관하게 독립적인 책임을 발생시킬 수 있다고 주장하며, 앞선 판결을 바탕으로 삼으려 하고 있다.

이 사건은 모델 출력보다 데이터 취득을 겨냥한다

소장은 Anthropic가 토렌트 네트워크와 소위 해적 라이브러리, 특히 LibGen과 PiLiMi를 사용한 데 초점을 맞추고 있는 것으로 알려졌다. The Decoder는 출판사들이 Anthropic가 이들 출처에서 최소 700만 권의 책을 토렌트로 받았다고 주장하며, 그중에는 가사와 음악 자료가 들어 있는 책도 포함됐다고 보도했다. 이 책들이 상업용 Claude 모델에 직접 사용되었는지는 증거개시에서 주요 쟁점이 될 것으로 보인다.

원고들은 또한 MusixMatch와 LyricFind 같은 라이선스 서비스에서 가사를 수집한 행위도 문제 삼고 있으며, 스크래핑이 플랫폼 약관과 출판사 권리를 위반했다고 주장한다. 소장에 언급된 다른 데이터셋으로는 Books3, The Pile, Common Crawl이 있으며, 출판사들은 이들에 무단 자료가 포함되어 있었다고 주장한다.

주장은 디지털 파일을 넘어선다. The Decoder는 소장이 Anthropic가 중고 노래책과 악보 컬렉션을 스캔하고 폐기했다고 비난한다고 보도했다. 또한 LibGen과 PiLiMi의 자료로 학습한 비상업 모델이 이후 상업용 Claude 모델의 개발 또는 피드백 과정에서 사용된 합성 데이터를 생성했다고도 주장한다.

Anthropic는 앞서 LibGen과 PiLiMi의 책을 상업용 제품 학습에 직접 사용한 적이 없다고 부인한 바 있다. The Decoder에 따르면 출판사들의 주장은, 그런 부인이 Anthropic의 ‘학습’ 정의에 달려 있을 수 있으며 파생 데이터나 합성 데이터 사용은 다루지 못할 수 있다는 것이다.

증거, 주장, 그리고 잠재적 손해배상

현재 가장 확실한 사실은 출판사들이 소송을 제기했고, Anthropic와 그 임원들이 피고로 지목됐으며, Anthropic가 혐의를 부인하고 있다는 점이다. 토렌트 사용, 데이터셋, 모델 개발 경로, 경영진 지시에 관한 더 상세한 주장들은 TechCrunch와 The Decoder가 보도한 원고의 소장에서 나온 것이다. 이들은 여전히 다툼 중이다.

The Decoder는 소장이 침해된 각 저작물당 최대 15만 달러, 그리고 고지문이나 식별 메타데이터 같은 저작권 관리정보 삭제와 관련된 위반당 최대 2만5천 달러를 요구하고 있다고 보도했다. 최종 노출액은 어떤 청구가 살아남는지, 몇 작품이 적용 대상인지, 그리고 법원이 출판사들의 책임 이론을 받아들이는지에 따라 달라질 것이다.

이 사건은 AI 기업에 어려운 증거 문제도 제기한다. 사전학습 데이터셋, 합성 데이터 파이프라인, 평가 시스템, 강화 과정 등을 거칠 때 무엇이 보호 콘텐츠의 사용으로 간주되는가? 기업은 원본 파일과 이후 모델을 구분할 수 있지만, 권리자들은 각 단계가 최초의 무단 취득 또는 복제를 반영한다고 주장할 수 있다.

The Decoder가 인용한 2025년 11월 뮌헨 지방법원 판결은 국제적 참고점을 더한다. 그 법원은 보호되는 가사가 모델 파라미터 내 복제로 간주될 수 있고, 생성된 가사 출력은 불법적 공중 공개에 해당할 수 있다고 판시했다. 이 판결은 미국 사건의 결정은 아니지만, 법원이 모델 내부와 생성 콘텐츠 모두를 살피고 있음을 보여준다.

AI 개발자와 기업 구매자가 주목해야 하는 이유

모델 개발자에게 이번 소송은 데이터 출처를 단순한 데이터셋 이름 이상으로 문서화해야 한다는 압박을 높인다. 팀은 파일의 출처, 적용된 라이선스, 서비스 약관 해석 방식, 제한된 자료가 합성 데이터나 강화학습 파이프라인에 들어갔는지 보여주는 기록이 필요할 수 있다.

기업 구매자에게는 이 분쟁이 공급업체 실사에 또 하나의 층을 더한다. 이제 모델의 저작권 정책에 대한 질문은 노래 가사나 책을 재현하는지 여부뿐 아니라, 제공자가 학습 데이터의 적법한 취득과 거버넌스를 입증할 수 있는지까지 포함한다. 계약상 면책, 감사 권한, 모델 버전 통제, 고위험 출력 제한 등이 조달에서 더 중요해질 수 있다.

이 사건은 AI 학습의 경제성에도 영향을 줄 수 있다. 법원이 해적판 취득을 별도의 책임 원인으로 다룬다면, 기업은 데이터가 학습 실행에 들어가기 전에 라이선스된 코퍼스, 필터링, 출처 시스템, 법률 검토에 더 많은 비용을 써야 할 수 있다. 이는 모든 저작권 문제를 해결하지는 못하더라도, 기초 모델 제공자들 사이에서 데이터 조달을 더 눈에 띄는 경쟁 요소로 만들 수 있다.

앞으로 주목할 점

첫 신호는 Anthropic의 공식 답변과 소장을 다투는 각종 신청에서 나올 것이다. 증거개시는 문제의 파일이 Claude의 상업용 학습 파이프라인에 들어갔는지, 합성 데이터를 통해 간접적으로 사용됐는지, 아니면 다른 개발 목적으로 보관됐는지를 보여줄 것이다.

개발자들은 경영진 책임, 토렌트 사용을 독립적 침해로 볼 것인지, 그리고 출판사들이 특정 작품을 특정 모델이나 학습 단계에 연결할 수 있는지에 대한 법원 판단을 지켜봐야 한다. AI 기업과 음악 권리자 간의 라이선스 계약도 이번 소송이 시장을 협상된 접근으로 밀고 있는지 보여줄 것이다.

이 사건과 Bartz v. Anthropic의 관계도 특히 중요하다. 만약 이전 판결이 취득 방식에 대한 책임의 토대가 된다면, 데이터셋에 분쟁 중인 자료가 포함된 다른 권리자들도 유사한 청구를 모델 개발자들에게 제기할 수 있다.

Creati.ai 관점

이번 소송은 AI 모델이 무엇을 만들어내는가라는 익숙한 질문에서 벗어나, 그 학습 데이터를 조립하는 덜 보이는 시스템으로 시선을 옮긴다. Anthropic에게 법적 위험은 Claude의 프롬프트 수준 행동만큼이나 조달, 스크래핑 통제, 내부 데이터 계보에 달려 있을 수 있다.

더 넓은 시장에 대한 실용적 교훈은 더 좁지만 중요하다. 법원이 중간 모델, 합성 데이터, 피드백 파이프라인을 들여다본다면 “직접 학습하지 않았다”는 말만으로는 충분한 컴플라이언스 답변이 아닐 수 있다. 데이터가 어디서 왔는지, 그리고 권리가 불분명했을 때 무엇을 했는지 증명할 수 있는 AI 기업이 저작권 소송이 모델 개발 인프라 깊숙이 파고들수록 더 유리한 위치에 설 것이다.

광고