Googles Gemini-KI sieht sich einer Sammelklage gegenüber, die vor einem Bundesgericht in New York eingereicht wurde und dem Unternehmen vorwirft, seine Modelle ohne Erlaubnis mit urheberrechtlich geschützten Büchern und Artikeln trainiert zu haben. Die Klage, die von einer Koalition aus großen Verlagen und dem Autor Scott Turow erhoben wurde, besagt, dass Google vorsätzlich Urheberrechtsinformationen entfernt hat, um die Verwendung „gestohlener Materialien“ in seinem generativen KI-System zu verbergen.

Die Klage und ihre Kernvorwürfe

Die Klageschrift vor dem U.S. District Court for the Southern District of New York führt Hachette, Cencage, Elsevier, das S.C.R.I.B.E.-Kollektiv und Turow als Kläger auf. Sie behaupten, Google sei über die „nur Snippets“-Vereinbarung hinausgegangen, die Google Books regelte, indem das Unternehmen Volltextwerke aus diesem Archiv und aus Titeln, die bei Google Play hochgeladen wurden, zum Training von Gemini verwendete. Der Klage zufolge hat Google die Inhalte nicht nur gescrapt, sondern auch Urheberrechts-Metadaten geändert oder entfernt – ein Schritt, der laut den Klägern darauf abzielte, die Urheberrechtsverletzung zu verschleiern.

Ein in der Klage erwähntes internes Google-Memo warnt davor, dass die Verwendung urheberrechtlich geschützter Bücher für das KI-Training „äußerst problematisch“ sein könnte und das Unternehmen Bußgeldern in Höhe von 10 bis 100 Milliarden US-Dollar aussetzen könnte. Die Kläger verweisen auf eine kürzlich verhängte Strafe von 1,5 Milliarden US-Dollar gegen ein anderes KI-Unternehmen wegen unbefugter Datennutzung als Maßstab für das Ausmaß der potenziellen Haftung.

Wie es dazu kam

Die Beziehung von Google zu Buchverlagen begann mit Google Books, einem durchsuchbaren Index, der kurze Auszüge und bibliografische Details anzeigte, während der Volltext hinter einer Paywall blieb. Dieses Modell beruhte auf Lizenzvereinbarungen, die Google darauf beschränkten, lediglich Snippets anzuzeigen. Im Laufe der Jahre erweiterte Google seinen Bestand über den Google Play Store, in dem Verlage und Autoren E-Books im Volltext zum Verkauf hochladen.

Die Kläger argumentieren, dass Googles Wandel von einem „umfangsbeschränkten“ Indexierungsdienst zu einer Datenquelle für das Training großer Sprachmodelle (LLMs) gegen die ursprünglichen Vereinbarungen verstößt. Sie sagen, das Unternehmen habe nie die umfassenden Genehmigungen eingeholt, die erforderlich sind, um ganze Werke in die Trainingspipeline von Gemini aufzunehmen.

Was für Google und die KI-Branche auf dem Spiel steht

Sollte ein Gericht feststellen, dass die Nutzung von urheberrechtlich geschütztem Material ohne Lizenz gegen das Urheberrecht verstößt, könnte diese Entscheidung die Art und Weise, wie KI-Entwickler Trainingsdaten zusammenstellen, grundlegend verändern.

Mögliche Verteidigungsstrategien und Gegenargumente

Google wird sich wahrscheinlich auf die „Fair Use“-Doktrin berufen, die eine begrenzte Nutzung von urheberrechtlich geschütztem Material für Kommentare, Kritik oder Transformationen erlaubt. Jüngste Urteile in Kalifornien haben das KI-Training als transformative Tätigkeit eingestuft und ihm Fair-Use-Schutz gewährt. Die Kläger in New York haben außerhalb dieser Gerichtsbarkeit geklagt, um diese Präzedenzfälle zu umgehen.

Die Kläger halten dagegen, dass das Entfernen von Urheberrechts-Metadaten die Absicht zeigt, die Quelle zu verschleiern, was jegliche Behauptung einer Transformation in gutem Glauben untergrabe. Sie führen zudem das interne Memo als Beweis dafür an, dass Google das rechtliche Risiko erkannt hatte.

Worauf man als Nächstes achten sollte

Der Fall wird durch Anträge im Vorverfahren gehen, die die Argumente beider Seiten prägen könnten, einschließlich der Frage, ob das Gericht die in Kalifornien angewandte Fair-Use-Analyse anwenden oder einen anderen Standard festlegen wird. Eine Entscheidung über die Zuständigkeit könnte bestimmen, ob die Gerichte in New York zum primären Ort für urheberrechtliche Streitigkeiten im Zusammenhang mit KI werden.

Fazit: Die Klage in New York gegen Googles Gemini könnte die Grenze zwischen zulässiger Datennutzung und Urheberrechtsverletzung neu ziehen, KI-Entwickler dazu zwingen, die Beschaffung des Rohmaterials für ihre Modelle zu überdenken, und die wirtschaftlichen Rahmenbedingungen der gesamten Branche verändern.