Sony Music und Warner-Verleger verklagen Anthropic wegen mutmaßlicher Piraterie zur Schulung von Claude

Sony Music und Warner-Verleger verklagten Anthropic wegen mutmaßlicher Piraterie und unbefugtem KI-Training und weiteten damit die Urheberrechtsrisiken rund um Claude und die Herkunft der Daten aus.

AI News

Sony Music Publishing, Warner Chappell und andere Musikverlage haben Anthropic und dessen leitende Führungskräfte vor einem Bundesgericht verklagt und werfen dem KI-Unternehmen vor, urheberrechtlich geschützte Songs, Texte und Notenblätter rechtswidrig beschafft und verwendet zu haben, um Claude zu entwickeln. Die Klage stellt den Streit nicht einfach als Frage dar, ob urheberrechtlich geschütztes Material für das KI-Training verwendet werden darf, sondern auch, wie Anthropic dieses Material angeblich beschafft hat.

Die Klage wurde beim U.S. District Court for the Northern District of California eingereicht und nennt Anthropic, CEO Dario Amodei und Mitgründer Benjamin Mann als Beklagte. Die Verlage werfen dem Unternehmen vor, große Mengen geschützter Werke ohne Genehmigung per Torrenting, Scraping und Download bezogen zu haben. Anthropic sagte gegenüber TechCrunch, dass es die Vorwürfe bestreite und sich verteidigen werde.

Ein neuer Urheberrechtsstreit für Anthropic

Die Klage fügt Anthropic bereits einem erheblichen Rechtsproblem eine weitere große Herausforderung aus der Musikindustrie hinzu. Laut Berichten von TechCrunch und The Decoder behaupten die Kläger, dass Zehntausende musikalischer Kompositionen bei der Entwicklung von Claude-Modellen verwendet wurden, vor allem in Form von Songtexten, zusammen mit Notenblättern und verwandten Werken.

Die Verlage beschreiben das mutmaßliche Verhalten in außergewöhnlich scharfen Worten und charakterisieren es als groß angelegten und fortgesetzten Diebstahl geistigen Eigentums. Diese Beschreibungen sind Vorwürfe in der Klage, keine Feststellungen des Gerichts.

Die Klage folgt auf einen früheren Streit von Anthropic mit Autoren und Verlagen in Bartz v. Anthropic. In diesem Fall erklärte sich das Unternehmen bereit, 1,5 Milliarden US-Dollar zu zahlen, nachdem ein Gericht festgestellt hatte, dass der Erwerb urheberrechtlich geschützter Bücher durch Piraterie rechtswidrig war, auch wenn die getrennte Frage der Nutzung urheberrechtlich geschützten Materials für das Training anders behandelt wurde. TechCrunch berichtete, dass das Gericht die Zahlung anordnete; The Decoder bezeichnete dies als Vergleich.

Diese Unterscheidung ist für den neuen Fall zentral. Die Musikverlage versuchen, auf dem früheren Urteil aufzubauen, indem sie argumentieren, dass eine unbefugte Beschaffung unabhängig davon haftungsbegründend sein kann, ob die Dateien später direkt in ein kommerzielles Modell eingeflossen sind.

Der Fall zielt auf die Datenbeschaffung, nicht nur auf die Modellausgaben

Die Klage konzentriert sich Berichten zufolge auf die Nutzung von Torrent-Netzwerken und sogenannten Piratenbibliotheken durch Anthropic, darunter LibGen und PiLiMi. The Decoder berichtete, die Verlage behaupteten, Anthropic habe aus diesen Quellen mindestens sieben Millionen Bücher per Torrent bezogen, darunter Bücher mit Songtexten und musikalischem Material. Ob diese Bücher direkt in kommerziellen Claude-Modellen verwendet wurden, dürfte in der Beweisaufnahme zu einem zentralen Thema werden.

Die Kläger gehen Berichten zufolge außerdem gegen die Sammlung von Songtexten aus lizenzierten Diensten wie MusixMatch und LyricFind vor und argumentieren, dass das Scraping gegen Plattformbedingungen und Verlagsrechte verstoßen habe. Weitere in der Klage genannte Datensätze sind Books3, The Pile und Common Crawl, die nach Angaben der Verlage unbefugtes Material enthalten haben sollen.

Die Vorwürfe gehen über digitale Dateien hinaus. The Decoder berichtete, die Klage werfe Anthropic vor, gebrauchte Songbücher und Notensammlungen gescannt und vernichtet zu haben. Außerdem heiße es, ein nicht-kommerzielles Modell, das mit Material aus LibGen und PiLiMi trainiert wurde, habe synthetische Daten erzeugt, die später in der Entwicklung oder im Feedback-Prozess für ein kommerzielles Claude-Modell verwendet worden seien.

Anthropic hat zuvor bestritten, Bücher aus LibGen und PiLiMi direkt für das Training kommerzieller Produkte verwendet zu haben. Das Argument der Verlage, so The Decoder, sei, dass eine solche Verneinung von Anthropics Definition von „Training“ abhängen könne und die Nutzung abgeleiteter oder synthetischer Daten womöglich nicht erfasse.

Beweise, Vorwürfe und mögliche Schadensersatzsummen

Die derzeit stärksten Fakten sind, dass die Verlage die Klage eingereicht haben, dass Anthropic und seine Führungskräfte als Beklagte genannt werden und dass Anthropic die Vorwürfe zurückgewiesen hat. Die detaillierteren Behauptungen über Torrenting, Datensätze, Wege der Modellentwicklung und Vorgaben der Unternehmensführung stammen aus der von TechCrunch und The Decoder berichteten Klageschrift der Kläger. Sie sind weiterhin streitig.

The Decoder berichtete, dass die Klage bis zu 150.000 US-Dollar für jedes verletzte Werk sowie bis zu 25.000 US-Dollar pro Verstoß wegen der Entfernung von Copyright-Management-Informationen, etwa Hinweisen oder identifizierenden Metadaten, fordert. Das letztliche Risiko würde davon abhängen, welche Ansprüche Bestand haben, wie viele Werke als betroffen gelten und ob das Gericht die Haftungstheorien der Verlage akzeptiert.

Der Fall wirft auch eine schwierige Beweisfrage für KI-Unternehmen auf: Was gilt als Nutzung geschützter Inhalte, wenn diese durch Vortrainingsdatensätze, synthetische Daten-Pipelines, Evaluierungssysteme oder Verstärkungsprozesse laufen? Ein Unternehmen kann zwischen einer Quelldatei und dem späteren Modell unterscheiden, während Rechteinhaber argumentieren können, dass jede Stufe die ursprüngliche unbefugte Beschaffung oder Vervielfältigung widerspiegelt.

Ein im November 2025 ergangenes Urteil des Landgerichts München, das The Decoder zitiert, liefert einen internationalen Vergleichspunkt. Dieses Gericht entschied, dass geschützte Songtexte als Vervielfältigungen innerhalb von Modellparametern gelten können und dass erzeugte Songtext-Ausgaben eine unrechtmäßige öffentliche Zugänglichmachung darstellen können. Das Urteil ist keine Entscheidung im US-Verfahren, zeigt aber, wie Gerichte sowohl Modellinterna als auch generierte Inhalte prüfen.

Warum sich KI-Entwickler und Unternehmenskunden kümmern sollten

Für Modellentwickler erhöht die Klage den Druck, die Herkunft der Daten in einer Tiefe zu dokumentieren, die über bloße Datensatznamen hinausgeht. Teams könnten Nachweise benötigen, woher Dateien stammen, welche Lizenzen galten, wie Nutzungsbedingungen ausgelegt wurden und ob eingeschränktes Material in synthetische Daten- oder Reinforcement-Learning-Pipelines gelangte.

Für Unternehmenskunden fügt der Streit der Lieferantenprüfung eine weitere Ebene hinzu. Fragen zur Urheberrechtspolitik eines Modells betreffen nun nicht nur, ob es Songtexte oder Bücher reproduziert, sondern auch, ob der Anbieter die rechtmäßige Beschaffung und Governance der Trainingsdaten nachweisen kann. Vertragliche Freistellung, Audit-Rechte, Modellversionskontrollen und Beschränkungen für risikoreiche Ausgaben könnten bei Beschaffungen wichtiger werden.

Der Fall könnte auch die Wirtschaftlichkeit des KI-Trainings beeinflussen. Wenn Gerichte die beschaffte Piraterie als eigenständige Haftungsquelle behandeln, könnten Unternehmen gezwungen sein, mehr für lizenzierte Korpora, Filterung, Herkunftssysteme und rechtliche Prüfung auszugeben, bevor Daten in einen Trainingslauf gelangen. Das würde nicht jede Urheberrechtsfrage lösen, aber die Datenbeschaffung als sichtbaren Wettbewerbsfaktor unter Anbietern von Foundation Models stärker in den Vordergrund rücken.

Worauf als Nächstes zu achten ist

Die ersten Signale werden von Anthropics formeller Erwiderung und etwaigen Anträgen kommen, die die Klage angreifen. Die Beweisaufnahme dürfte zeigen, ob die angeblichen Dateien in Anthropics kommerzielle Claude-Trainingspipeline gelangten, indirekt über synthetische Daten verwendet wurden oder aus anderen Entwicklungsgründen aufbewahrt wurden.

Entwickler sollten auf gerichtliche Entscheidungen zur Haftung von Führungskräften, auf die Behandlung von Torrenting als eigenständige Urheberrechtsverletzung und auf die Fähigkeit der Verlage achten, konkrete Werke mit bestimmten Modellen oder Trainingsstufen zu verknüpfen. Lizenzvereinbarungen zwischen KI-Unternehmen und Rechteinhabern im Musikbereich würden ebenfalls zeigen, ob die Klage den Markt in Richtung verhandelten Zugangs drängt.

Die Interaktion des Falls mit Bartz v. Anthropic wird besonders wichtig sein. Wenn die frühere Entscheidung zur Grundlage für Haftung wegen Beschaffungsmethoden wird, könnten andere Rechteinhaber ähnliche Ansprüche gegen Modellentwickler verfolgen, deren Datensätze umstrittenes Material enthalten.

Creati.ai-Perspektive

Diese Klage lenkt die Aufmerksamkeit von der bekannten Frage, was ein KI-Modell ausgibt, auf die weniger sichtbaren Systeme, die seine Trainingsdaten zusammenstellen. Für Anthropic könnte sich das rechtliche Risiko ebenso stark aus Beschaffung, Scraping-Kontrollen und interner Datenherkunft ergeben wie aus dem Verhalten von Claude auf Prompt-Ebene.

Für den breiteren Markt ist die praktische Lehre enger, aber folgenreich: „nicht direkt trainiert auf“ könnte keine ausreichende Compliance-Antwort sein, wenn Gerichte Zwischenmodelle, synthetische Daten und Feedback-Pipelines prüfen. KI-Unternehmen, die nachweisen können, woher ihre Daten stammen – und was sie taten, als Rechte unklar waren –, werden besser positioniert sein, wenn sich die Urheberrechtsstreitigkeiten tiefer in die Infrastruktur der Modellentwicklung verlagern.

Anzeigen