Sony Music et Warner Publishers poursuivent Anthropic pour une prétendue piraterie utilisée pour entraîner Claude

Sony Music et Warner Publishers ont poursuivi Anthropic pour piraterie présumée et entraînement IA non autorisé, élargissant les risques de droit d’auteur autour de Claude et de l’origine des données.

AI News

Sony Music Publishing, Warner Chappell et d’autres éditeurs de musique ont poursuivi Anthropic et ses dirigeants devant un tribunal fédéral, alléguant que l’entreprise d’IA avait obtenu et utilisé illégalement des chansons, des paroles et des partitions protégées par le droit d’auteur pour développer Claude. La plainte présente le litige non seulement comme une question de savoir si des contenus protégés peuvent être utilisés pour l’entraînement de l’IA, mais aussi comme une question de la manière dont Anthropic les aurait acquis.

Déposée devant le tribunal de district des États-Unis pour le district nord de la Californie, l’affaire cite Anthropic, le PDG Dario Amodei et le cofondateur Benjamin Mann comme défendeurs. Les éditeurs accusent l’entreprise d’avoir téléchargé via torrent, aspiré et récupéré de grands volumes d’œuvres protégées sans autorisation. Anthropic a indiqué à TechCrunch qu’elle contestait les accusations et qu’elle avait l’intention de se défendre.

Un nouveau combat sur le droit d’auteur pour Anthropic

La plainte ajoute un défi majeur de l’industrie musicale à un problème juridique déjà important pour Anthropic. Selon des informations de TechCrunch et The Decoder, les plaignants allèguent que des dizaines de milliers de compositions musicales ont été utilisées dans le développement des modèles Claude, principalement sous forme de paroles de chansons, avec des partitions et des œuvres connexes.

Les éditeurs décrivent les faits allégués en des termes exceptionnellement graves, les qualifiant de vol d’ampleur massive et continu de propriété intellectuelle. Ces descriptions sont des allégations contenues dans la plainte, et non des constatations du tribunal.

L’action fait suite au litige antérieur d’Anthropic avec des auteurs et des éditeurs dans Bartz v. Anthropic. Dans cette affaire, l’entreprise a accepté de verser 1,5 milliard de dollars après qu’un tribunal eut estimé que l’acquisition de livres protégés par le droit d’auteur par piratage était illégale, tout en traitant différemment la question distincte de l’utilisation de contenus protégés pour l’entraînement. TechCrunch a rapporté que le tribunal avait ordonné le paiement ; The Decoder l’a décrit comme un règlement.

Cette distinction est centrale dans la nouvelle affaire. Les éditeurs de musique cherchent à s’appuyer sur la décision précédente en soutenant que l’acquisition non autorisée peut engager la responsabilité indépendamment du fait que les fichiers aient ensuite été ou non inclus directement dans un modèle commercial.

L’affaire vise l’acquisition des données, pas seulement les sorties du modèle

La plainte se concentre apparemment sur l’utilisation par Anthropic de réseaux torrent et des soi-disant bibliothèques pirates, notamment LibGen et PiLiMi. The Decoder a rapporté que les éditeurs affirment qu’Anthropic a téléchargé via torrent au moins sept millions de livres provenant de ces sources, y compris des livres contenant des paroles et du matériel musical. La question de savoir si ces livres ont été utilisés directement dans des modèles Claude commerciaux devrait devenir un enjeu majeur lors de la phase de découverte.

Les plaignants contesteraient également la collecte de paroles à partir de services sous licence tels que MusixMatch et LyricFind, arguant que le scraping violait les conditions des plateformes et les droits des éditeurs. Parmi les autres ensembles de données nommés dans la plainte figurent Books3, The Pile et Common Crawl, que les éditeurs affirment contenir des contenus non autorisés.

Les allégations vont au-delà des fichiers numériques. The Decoder a rapporté que la plainte accuse Anthropic d’avoir scanné et détruit des recueils de chansons d’occasion et des collections de partitions. Elle allègue aussi qu’un modèle non commercial entraîné avec des contenus provenant de LibGen et PiLiMi a généré des données synthétiques ensuite utilisées dans le développement ou le processus de retour d’information d’un modèle Claude commercial.

Anthropic a précédemment nié avoir utilisé directement des livres de LibGen et PiLiMi pour entraîner des produits commerciaux. Selon The Decoder, l’argument des éditeurs est qu’un tel démenti peut dépendre de la définition qu’Anthropic donne de l’« entraînement » et qu’il ne traite pas nécessairement de l’utilisation de données dérivées ou synthétiques.

Preuves, allégations et dommages potentiels

Les faits les plus solides actuellement disponibles sont que les éditeurs ont déposé l’affaire, qu’Anthropic et ses dirigeants sont désignés comme défendeurs et qu’Anthropic a rejeté les accusations. Les allégations plus détaillées concernant le torrenting, les ensembles de données, les trajectoires de développement du modèle et les directives des dirigeants proviennent de la plainte des demandeurs telle que rapportée par TechCrunch et The Decoder. Elles restent contestées.

The Decoder a rapporté que la plainte demande jusqu’à 150 000 dollars pour chaque œuvre contrefaite et jusqu’à 25 000 dollars par violation impliquant la suppression d’informations de gestion du droit d’auteur, telles que des mentions ou des métadonnées d’identification. L’exposition finale dépendra des griefs qui survivront, du nombre d’œuvres jugées couvertes et de l’acceptation ou non par le tribunal des théories de responsabilité avancées par les éditeurs.

L’affaire soulève également une question probatoire délicate pour les entreprises d’IA : qu’est-ce qui constitue l’utilisation de contenus protégés lorsqu’ils transitent par des ensembles de données de préentraînement, des pipelines de données synthétiques, des systèmes d’évaluation ou des processus de renforcement ? Une entreprise peut distinguer entre un fichier source et le modèle final, tandis que les titulaires de droits peuvent soutenir que chaque étape reflète l’acquisition ou la reproduction initiale non autorisée.

Une décision de novembre 2025 du tribunal régional de Munich, citée par The Decoder, apporte un point de comparaison international. Ce tribunal a jugé que des paroles protégées peuvent compter comme des reproductions au sein des paramètres d’un modèle et que des sorties de paroles générées peuvent constituer une communication publique illicite. Cette décision ne concerne pas l’affaire américaine, mais elle illustre la manière dont les tribunaux examinent à la fois les éléments internes des modèles et les contenus générés.

Pourquoi les développeurs d’IA et les acheteurs entreprises devraient s’en soucier

Pour les développeurs de modèles, la plainte accroît la pression pour documenter la provenance des données à un niveau qui dépasse les simples noms de jeux de données. Les équipes pourraient avoir besoin d’archives montrant d’où proviennent les fichiers, quelles licences s’appliquaient, comment les conditions d’utilisation ont été interprétées et si des contenus restreints ont intégré des pipelines de données synthétiques ou d’apprentissage par renforcement.

Pour les acheteurs entreprises, le litige ajoute une couche supplémentaire à la diligence raisonnable vis-à-vis des fournisseurs. Les questions relatives à la politique de droit d’auteur d’un modèle portent désormais non seulement sur la reproduction de paroles ou de livres, mais aussi sur la capacité du fournisseur à démontrer l’acquisition licite et la gouvernance des données d’entraînement. Les clauses d’indemnisation, les droits d’audit, les contrôles de versions des modèles et les restrictions sur les sorties à haut risque pourraient devenir plus importants dans les achats.

L’affaire pourrait aussi affecter l’économie de l’entraînement de l’IA. Si les tribunaux considèrent l’acquisition de contenus piratés comme une source distincte de responsabilité, les entreprises pourraient devoir consacrer davantage de moyens à des corpus sous licence, au filtrage, aux systèmes de provenance et à l’examen juridique avant que les données n’atteignent une exécution d’entraînement. Cela ne résoudrait pas toutes les questions de droit d’auteur, mais cela pourrait faire de l’origine des données un facteur concurrentiel plus visible parmi les fournisseurs de modèles de fondation.

Ce qu’il faut surveiller ensuite

Les premiers signaux viendront de la réponse formelle d’Anthropic et de toute requête contestant la plainte. La phase de découverte devrait montrer si les fichiers allégués sont entrés dans le pipeline commercial d’entraînement de Claude, ont été utilisés indirectement via des données synthétiques ou ont été conservés à d’autres fins de développement.

Les développeurs devraient surveiller les décisions judiciaires sur la responsabilité des dirigeants, le traitement du torrenting comme contrefaçon autonome et la capacité des éditeurs à relier des œuvres précises à des modèles ou à des étapes d’entraînement particulières. Les accords de licence entre les entreprises d’IA et les titulaires de droits musicaux indiqueraient également si le litige pousse le marché vers un accès négocié.

L’interaction de l’affaire avec Bartz v. Anthropic sera particulièrement importante. Si la décision précédente devient un fondement de responsabilité au titre des méthodes d’acquisition, d’autres titulaires de droits pourraient engager des actions similaires contre des développeurs de modèles dont les ensembles de données contiennent des contenus litigieux.

Point de vue de Creati.ai

Cette plainte déplace l’attention de la question familière de ce qu’un modèle d’IA produit vers les systèmes moins visibles qui assemblent ses données d’entraînement. Pour Anthropic, le risque juridique peut dépendre autant de l’approvisionnement, des contrôles de scraping et de la traçabilité interne des données que du comportement de Claude au niveau des prompts.

Pour le marché plus large, la leçon pratique est plus étroite mais importante : « pas entraîné directement sur » pourrait ne pas constituer une réponse de conformité suffisante si les tribunaux examinent les modèles intermédiaires, les données synthétiques et les pipelines de rétroaction. Les entreprises d’IA capables de prouver d’où proviennent leurs données — et ce qu’elles ont fait lorsque les droits n’étaient pas clairs — seront mieux positionnées à mesure que le contentieux sur le droit d’auteur s’enfonce davantage dans l’infrastructure du développement des modèles.

Publicités