Sony Music e Warner Publishers processam a Anthropic por suposta pirataria usada para treinar o Claude

Sony Music e Warner Publishers processaram a Anthropic por suposta pirataria e treinamento de IA não autorizado, ampliando os riscos de direitos autorais em torno do Claude e da origem dos dados.

AI News

Sony Music Publishing, Warner Chappell e outras editoras musicais processaram a Anthropic e seus principais executivos em um tribunal federal, alegando que a empresa de IA obteve e usou ilegalmente músicas, letras e partituras protegidas por direitos autorais para desenvolver o Claude. A queixa enquadra a disputa não apenas como uma questão sobre se material protegido por copyright pode ser usado para treinamento de IA, mas também sobre como a Anthropic supostamente o adquiriu.

Protocolado no Tribunal Distrital dos EUA para o Distrito Norte da Califórnia, o caso nomeia Anthropic, o CEO Dario Amodei e o cofundador Benjamin Mann como réus. As editoras acusam a empresa de fazer torrent, raspar e baixar grandes volumes de obras protegidas sem permissão. A Anthropic disse à TechCrunch que discorda das alegações e pretende se defender.

Uma nova batalha de direitos autorais para a Anthropic

O processo adiciona um grande desafio da indústria musical a um problema jurídico já significativo para a Anthropic. Segundo reportagens da TechCrunch e do The Decoder, os autores da ação alegam que dezenas de milhares de composições musicais foram usadas no desenvolvimento dos modelos Claude, principalmente na forma de letras de músicas, junto com partituras e obras relacionadas.

As editoras descrevem a suposta conduta em termos excepcionalmente graves, caracterizando-a como um roubo em larga escala e contínuo de propriedade intelectual. Essas descrições são alegações da queixa, não conclusões do tribunal.

A ação segue a disputa anterior da Anthropic com autores e editoras em Bartz v. Anthropic. Nesse caso, a empresa concordou em pagar US$ 1,5 bilhão depois que um tribunal concluiu que adquirir livros protegidos por direitos autorais por meio de pirataria era ilegal, embora tratasse de forma diferente a questão separada de usar material protegido para treinamento. A TechCrunch relatou que o tribunal ordenou o pagamento; o The Decoder descreveu isso como um acordo.

Essa distinção é central para o novo caso. As editoras musicais tentam se apoiar na decisão anterior argumentando que a aquisição não autorizada pode gerar responsabilidade independentemente de os arquivos terem sido depois incluídos diretamente em um modelo comercial.

O caso mira a aquisição de dados, e não apenas as saídas do modelo

A queixa supostamente se concentra no uso, pela Anthropic, de redes torrent e das chamadas bibliotecas piratas, incluindo LibGen e PiLiMi. O The Decoder informou que as editoras afirmam que a Anthropic baixou por torrent pelo menos sete milhões de livros dessas fontes, incluindo livros contendo letras e material musical. Se esses livros foram usados diretamente em modelos comerciais Claude deverá se tornar uma grande questão na fase de descoberta.

Os autores da ação também contestam, segundo relatos, a coleta de letras de serviços licenciados como MusixMatch e LyricFind, argumentando que o scraping violou os termos das plataformas e os direitos das editoras. Outros conjuntos de dados citados na queixa incluem Books3, The Pile e Common Crawl, que as editoras afirmam conter material não autorizado.

As alegações vão além dos arquivos digitais. O The Decoder relatou que a queixa acusa a Anthropic de escanear e destruir songbooks usados e coleções de partituras. Também alega que um modelo não comercial treinado com material da LibGen e da PiLiMi gerou dados sintéticos usados posteriormente no desenvolvimento ou no processo de feedback de um modelo Claude comercial.

A Anthropic já havia negado usar diretamente livros da LibGen e da PiLiMi para treinar produtos comerciais. O argumento das editoras, segundo o The Decoder, é que essa negativa pode depender da definição de “treinamento” da Anthropic e pode não abordar o uso de dados derivados ou sintéticos.

Provas, alegações e possíveis indenizações

Os fatos mais sólidos disponíveis no momento são que as editoras entraram com o caso, que Anthropic e seus executivos foram nomeados réus e que a Anthropic rejeitou as alegações. As acusações mais detalhadas sobre torrenting, conjuntos de dados, caminhos de desenvolvimento do modelo e direção executiva vêm da queixa dos autores, conforme relatado pela TechCrunch e pelo The Decoder. Elas continuam contestadas.

O The Decoder informou que a queixa pede até US$ 150 mil por cada obra infringida e até US$ 25 mil por violação envolvendo a remoção de informações de gestão de direitos autorais, como avisos ou metadados identificadores. A exposição final dependerá de quais reivindicações sobreviverem, de quantas obras forem consideradas cobertas e de o tribunal aceitar ou não as teorias de responsabilidade das editoras.

O caso também levanta uma difícil questão probatória para as empresas de IA: o que conta como uso de conteúdo protegido quando ele passa por conjuntos de dados de pré-treinamento, pipelines de dados sintéticos, sistemas de avaliação ou processos de reforço? Uma empresa pode distinguir entre um arquivo de origem e o modelo final, enquanto detentores de direitos podem argumentar que cada etapa reflete a aquisição ou reprodução original não autorizada.

Uma decisão de novembro de 2025 do Tribunal Regional de Munique, citada pelo The Decoder, acrescenta um ponto de referência internacional. Esse tribunal concluiu que letras protegidas podem contar como reproduções dentro dos parâmetros do modelo e que saídas de letras geradas podem equivaler a divulgação pública ilícita. A decisão não é do caso dos EUA, mas ilustra como os tribunais estão examinando tanto os componentes internos do modelo quanto o conteúdo gerado.

Por que construtores de IA e compradores corporativos devem se importar

Para desenvolvedores de modelos, o processo aumenta a pressão para documentar a procedência dos dados em um nível que vá além de nomes genéricos de conjuntos de dados. As equipes podem precisar de registros mostrando de onde vieram os arquivos, quais licenças se aplicavam, como os termos de serviço foram interpretados e se material restrito entrou em pipelines de dados sintéticos ou de aprendizado por reforço.

Para compradores corporativos, a disputa adiciona outra camada à diligência de fornecedores. Questões sobre a política de direitos autorais de um modelo agora incluem não apenas se ele reproduz letras ou livros, mas também se o provedor pode demonstrar aquisição legal e governança dos dados de treinamento. Indenização contratual, direitos de auditoria, controles de versão do modelo e restrições a saídas de alto risco podem se tornar mais importantes nas compras.

O caso também pode afetar a economia do treinamento de IA. Se os tribunais tratarem a aquisição de pirataria como uma fonte separada de responsabilidade, as empresas talvez tenham de gastar mais com corpora licenciados, filtragem, sistemas de procedência e revisão jurídica antes que os dados cheguem a uma execução de treinamento. Isso não resolveria todas as questões de direitos autorais, mas poderia tornar a origem dos dados um fator competitivo mais visível entre provedores de modelos fundamentais.

O que observar a seguir

Os primeiros sinais virão da resposta formal da Anthropic e de eventuais moções contestando a queixa. A fase de descoberta deve mostrar se os arquivos alegados entraram no pipeline comercial de treinamento do Claude, foram usados indiretamente por meio de dados sintéticos ou foram mantidos para outros fins de desenvolvimento.

Desenvolvedores devem observar decisões judiciais sobre responsabilidade de executivos, o tratamento do torrenting como infração autônoma e a capacidade das editoras de vincular obras específicas a modelos ou estágios de treinamento específicos. Acordos de licenciamento entre empresas de IA e detentores de direitos musicais também indicariam se o processo está empurrando o mercado para acesso negociado.

A interação do caso com Bartz v. Anthropic será especialmente importante. Se a decisão anterior se tornar uma base para responsabilidade sobre métodos de aquisição, outros detentores de direitos podem buscar reivindicações semelhantes contra desenvolvedores de modelos cujos conjuntos de dados contenham material contestado.

Perspectiva da Creati.ai

Este processo desloca a atenção da pergunta familiar sobre o que um modelo de IA produz para os sistemas menos visíveis que montam seus dados de treinamento. Para a Anthropic, o risco jurídico pode depender tanto de aquisição, controles de scraping e linhagem interna dos dados quanto do comportamento do Claude no nível do prompt.

Para o mercado em geral, a lição prática é mais restrita, mas importante: “não treinado diretamente com” pode não ser uma resposta de compliance suficiente se os tribunais examinarem modelos intermediários, dados sintéticos e pipelines de feedback. Empresas de IA que conseguirem provar de onde seus dados vieram — e o que fizeram quando os direitos não estavam claros — estarão melhor posicionadas à medida que o litígio de direitos autorais avançar mais profundamente na infraestrutura do desenvolvimento de modelos.

Anúncios