Sony Music y Warner Publishers demandan a Anthropic por presunta piratería usada para entrenar a Claude

Sony Music y Warner Publishers demandaron a Anthropic por presunta piratería y entrenamiento de IA no autorizado, ampliando los riesgos de derechos de autor en torno a Claude y el origen de los datos.

AI News

Sony Music Publishing, Warner Chappell y otros editores musicales han demandado a Anthropic y a sus altos cargos ante un tribunal federal, alegando que la empresa de IA obtuvo y utilizó ilegalmente canciones, letras y partituras protegidas por derechos de autor para desarrollar Claude. La demanda plantea la disputa no solo como una cuestión de si el material con copyright puede usarse para entrenar IA, sino también de cómo Anthropic lo habría adquirido.

Presentado ante el Tribunal de Distrito de EE. UU. para el Distrito Norte de California, el caso señala como demandados a Anthropic, al director ejecutivo Dario Amodei y al cofundador Benjamin Mann. Los editores acusan a la empresa de descargar mediante torrent, extraer y bajar grandes volúmenes de obras protegidas sin permiso. Anthropic dijo a TechCrunch que discrepa con las acusaciones y que piensa defenderse.

Una nueva batalla por derechos de autor para Anthropic

La demanda añade un gran desafío de la industria musical a un problema legal ya importante para Anthropic. Según informaron TechCrunch y The Decoder, los demandantes alegan que decenas de miles de composiciones musicales se utilizaron en el desarrollo de modelos de Claude, principalmente en forma de letras de canciones, junto con partituras y obras relacionadas.

Los editores describen la supuesta conducta en términos excepcionalmente graves, caracterizándola como un robo a gran escala y continuado de propiedad intelectual. Esas descripciones son alegaciones de la demanda, no conclusiones del tribunal.

La acción sigue a la disputa previa de Anthropic con autores y editores en Bartz v. Anthropic. En ese caso, la empresa aceptó pagar 1.500 millones de dólares después de que un tribunal determinara que adquirir libros protegidos por derechos de autor mediante piratería era ilegal, aunque tratara de forma distinta la cuestión separada de usar material con copyright para el entrenamiento. TechCrunch informó que el tribunal ordenó el pago; The Decoder lo describió como un acuerdo.

Esa distinción es central para el nuevo caso. Los editores musicales intentan apoyarse en la decisión anterior argumentando que la adquisición no autorizada puede generar responsabilidad de forma independiente de si luego los archivos fueron incluidos directamente en un modelo comercial.

El caso apunta a la adquisición de datos, no solo a las salidas del modelo

La demanda supuestamente se centra en el uso por parte de Anthropic de redes torrent y de las llamadas bibliotecas pirata, incluidas LibGen y PiLiMi. The Decoder informó que los editores afirman que Anthropic descargó por torrent al menos siete millones de libros de esas fuentes, incluidos libros con letras y material musical. Si esos libros se utilizaron directamente en modelos comerciales de Claude será probablemente una cuestión importante durante la fase de descubrimiento.

Los demandantes también cuestionan, según los informes, la recopilación de letras de servicios con licencia como MusixMatch y LyricFind, argumentando que el scraping violó las condiciones de las plataformas y los derechos de los editores. Otros conjuntos de datos mencionados en la demanda incluyen Books3, The Pile y Common Crawl, que los editores afirman que contenían material no autorizado.

Las acusaciones van más allá de los archivos digitales. The Decoder informó que la demanda acusa a Anthropic de escanear y destruir cancioneros usados y colecciones de partituras. También alega que un modelo no comercial entrenado con material de LibGen y PiLiMi generó datos sintéticos que después se usaron en el desarrollo o en el proceso de retroalimentación de un modelo comercial de Claude.

Anthropic ha negado previamente haber utilizado directamente libros de LibGen y PiLiMi para entrenar productos comerciales. El argumento de los editores, según The Decoder, es que tal negación puede depender de la definición que Anthropic haga de “entrenamiento” y puede no abordar el uso de datos derivados o sintéticos.

Pruebas, alegaciones y posibles daños

Los hechos más sólidos disponibles ahora son que los editores presentaron el caso, que Anthropic y sus ejecutivos figuran como demandados y que Anthropic ha rechazado las acusaciones. Las alegaciones más detalladas sobre torrenting, conjuntos de datos, vías de desarrollo del modelo y dirección ejecutiva proceden de la demanda de los demandantes, según informaron TechCrunch y The Decoder. Siguen siendo controvertidas.

The Decoder informó que la demanda reclama hasta 150.000 dólares por cada obra infringida y hasta 25.000 dólares por cada infracción relacionada con la eliminación de información de gestión de derechos de autor, como avisos o metadatos identificativos. La exposición final dependerá de qué reclamaciones sobrevivan, cuántas obras se considere que están cubiertas y si el tribunal acepta las teorías de responsabilidad de los editores.

El caso también plantea una difícil cuestión probatoria para las empresas de IA: ¿qué cuenta como uso de contenido protegido cuando pasa por conjuntos de datos de preentrenamiento, canales de datos sintéticos, sistemas de evaluación o procesos de refuerzo? Una empresa puede distinguir entre un archivo de origen y el modelo final, mientras que los titulares de derechos pueden sostener que cada etapa refleja la adquisición o reproducción original no autorizada.

Una sentencia de noviembre de 2025 del Tribunal Regional de Múnich, citada por The Decoder, añade un dato internacional. Ese tribunal sostuvo que las letras protegidas pueden contar como reproducciones dentro de los parámetros del modelo y que las salidas de letras generadas pueden equivaler a una divulgación pública ilícita. La resolución no es una decisión en el caso estadounidense, pero ilustra cómo los tribunales están examinando tanto los componentes internos del modelo como el contenido generado.

Por qué deberían preocuparse los desarrolladores de IA y los compradores empresariales

Para los desarrolladores de modelos, la demanda aumenta la presión para documentar el origen de los datos a un nivel que vaya más allá de los nombres generales de los conjuntos de datos. Los equipos pueden necesitar registros que muestren de dónde vinieron los archivos, qué licencias se aplicaban, cómo se interpretaron las condiciones de servicio y si material restringido entró en canales de datos sintéticos o de aprendizaje por refuerzo.

Para los compradores empresariales, la disputa añade otra capa al debido diligenciamiento de proveedores. Las preguntas sobre la política de derechos de autor de un modelo ahora incluyen no solo si reproduce letras o libros, sino también si el proveedor puede demostrar la adquisición legal y la gobernanza de los datos de entrenamiento. La indemnización contractual, los derechos de auditoría, los controles de versiones del modelo y las restricciones sobre salidas de alto riesgo pueden volverse más importantes en las compras.

El caso también podría afectar la economía del entrenamiento de IA. Si los tribunales tratan la adquisición pirata como una fuente separada de responsabilidad, las empresas podrían tener que gastar más en corpus con licencia, filtrado, sistemas de procedencia y revisión legal antes de que los datos lleguen a una ejecución de entrenamiento. Eso no resolvería todas las cuestiones de derechos de autor, pero sí podría hacer que el origen de los datos sea un factor competitivo más visible entre los proveedores de modelos fundacionales.

Qué vigilar a continuación

Las primeras señales llegarán con la respuesta formal de Anthropic y con cualquier moción que impugne la demanda. El descubrimiento debería mostrar si los archivos alegados entraron en la canalización comercial de entrenamiento de Claude, se usaron indirectamente a través de datos sintéticos o se conservaron para otros fines de desarrollo.

Los desarrolladores deberían vigilar las resoluciones judiciales sobre la responsabilidad de los ejecutivos, el tratamiento del torrenting como infracción autónoma y la capacidad de los editores para vincular obras concretas con modelos o etapas de entrenamiento específicas. Los acuerdos de licencia entre empresas de IA y titulares de derechos musicales también indicarían si la demanda está empujando al mercado hacia un acceso negociado.

La interacción del caso con Bartz v. Anthropic será especialmente importante. Si la decisión anterior se convierte en una base para la responsabilidad por los métodos de adquisición, otros titulares de derechos podrían presentar reclamaciones similares contra desarrolladores de modelos cuyos conjuntos de datos contengan material disputado.

Perspectiva de Creati.ai

Esta demanda desplaza la atención de la pregunta habitual sobre lo que produce un modelo de IA hacia los sistemas menos visibles que ensamblan sus datos de entrenamiento. Para Anthropic, el riesgo legal puede depender tanto de la adquisición, los controles de scraping y la procedencia interna de los datos como del comportamiento de Claude a nivel de prompt.

Para el mercado en general, la lección práctica es más estrecha pero importante: “no entrenado directamente con” puede no ser una respuesta de cumplimiento suficiente si los tribunales examinan modelos intermedios, datos sintéticos y canales de retroalimentación. Las empresas de IA que puedan demostrar de dónde procedían sus datos —y qué hicieron cuando los derechos no estaban claros— estarán mejor posicionadas a medida que el litigio por derechos de autor se adentre más en la infraestructura del desarrollo de modelos.

Anuncios