NYT wirft OpenAI vor, Beweise in bedeutendem Urheberrechtsverfahren zu verheimlichen
Der laufende Rechtsstreit zwischen der New York Times und OpenAI hat eine dramatische Wendung genommen, da Vorwürfe laut werden, der KI-Riese habe Beweise in Bezug auf seine Trainingsdatensätze vorsätzlich verschleiert. Diese Eskalation droht den Fokus der Klage von der Urheberrechtsverletzung auf die Integrität des gerichtlichen Offenlegungsverfahrens (Discovery Process) zu verlagern.
Vorwürfe wegen täuschender Datenpraktiken
Die New York Times und die Daily News behaupten, dass OpenAI in Bezug auf seine technische Fähigkeit, sowohl seinen Trainingskorpus als auch die Chat-Protokolle der Kunden zu durchsuchen, unwahrheitsgemäße Angaben gemacht habe. Während des zweijährigen Rechtsstreits vertrat OpenAI stets die Position, dass die Durchsuchung seiner massiven Datensätze technisch zu aufwendig wäre und den Datenschutz der Nutzer gefährden würde.
Eine jüngste Zeugenaussage (Deposition) des OpenAI-Datenschutzingenieurs Vinnie Monaco stellt dieses Narrativ jedoch infrage. Monaco soll enthüllt haben, dass OpenAI bereits interne Suchläufe in seinem Trainingskorpus durchgeführt habe, um gezielt urheberrechtlich geschützte journalistische Werke zu identifizieren. Darüber hinaus deutet die Aussage darauf hin, dass OpenAI eine Datenbank mit etwa 78 Millionen anonymisierten ChatGPT-Konversationen zusammengestellt hatte, um das Ausmaß potenzieller Urheberrechtsverletzungen intern zu bewerten.
Project Giraffe und der „Bloom“-Filter
Die vielleicht bedeutendste technische Enthüllung betrifft „Project Giraffe“, eine von OpenAI implementierte Tool-Sammlung. Den Klägern zufolge nutzte OpenAI kurz nach Einreichung der Klage im Rahmen dieses Projekts einen „Bloom“-Filter, um Fälle von „Regurgitation“ (Wiederholung) zu erkennen und zu protokollieren – also Momente, in denen das Modell urheberrechtlich geschützte Inhalte wortwörtlich in seinen Ausgaben reproduziert.
Die Existenz von Project Giraffe widerspricht der bisherigen Haltung von OpenAI, wonach die Identifizierung spezifischer Fälle von Inhaltsreproduktionen in den Protokollen eine unzumutbare Aufgabe sei. Die Kläger argumentieren, dass diese Tools beweisen, dass OpenAI nicht nur in der Lage war, Urheberrechtsverletzungen zu überwachen, sondern aktiv eine Infrastruktur zu deren Verfolgung aufbaute.
Streitigkeiten über Datenintegrität und Offenlegung
Der Konflikt drehte sich zudem um die Qualität der dem Gericht zur Verfügung gestellten Daten. Während die Kläger ursprünglich eine Stichprobe von 120 Millionen Chat-Protokollen angefordert hatten, konnte OpenAI die Zahl auf 20 Millionen reduzieren. Als die Stichprobe schließlich im Dezember eingereicht wurde, befand das Gericht diese Berichten zufolge aufgrund übermäßiger Schwärzungen als „unbrauchbar“.
Die NYT geht noch weiter und behauptet, dass OpenAI Milliarden von ChatGPT-Ausgaben unter Verstoß gegen eine gerichtliche Anordnung zur Datenerhaltung gelöscht und Millionen von Protokollen in der bereitgestellten Stichprobe ersetzt habe. Als Reaktion darauf hat der OpenAI-Sprecher Drew Pusateri alle Vorwürfe zurückgewiesen und der Times vorgeworfen, zu versuchen, die Privatsphäre der Nutzer zu verletzen, während ihr Rechtsfall schwächer werde.
Warum dies für die KI-Branche von Bedeutung ist
Dieser Fall ist ein Wegweiser für die Zukunft der Entwicklung generativer KI und die rechtlichen Grenzen von „Fair Use“. Sollte das Gericht feststellen, dass OpenAI Beweise zurückgehalten oder das Offenlegungsverfahren manipuliert hat, könnte dies einen Präzedenzfall dafür schaffen, wie KI-Unternehmen verpflichtet sind, ihre Trainingsmethoden und die Herkunft ihrer Daten (Data Lineage) offenzulegen. Für Entwickler und KI-Gründer wird das Ergebnis klären, welches Maß an Transparenz erforderlich ist, wenn man sich an der Schnittstelle zwischen massivem Datenimport und geistigen Eigentumsrechten bewegt.
Wichtigste Erkenntnisse
- Interne Überwachungstools: Vorwürfe deuten darauf hin, dass OpenAI „Project Giraffe“ und einen „Bloom“-Filter einsetzte, um die Wiederholung urheberrechtlich geschützter Inhalte aktiv zu verfolgen.
- Widersprüchliche Aussagen: Beweise aus Zeugenaussagen legen nahe, dass OpenAI über die technische Fähigkeit verfügte, seine Trainingsdaten zu durchsuchen, was den bisherigen Behauptungen über den technischen Aufwand widerspricht.
- Integrität der Offenlegung gefährdet: Der Rechtsstreit hängt nun davon ab, ob OpenAI Anordnungen zur Datenerhaltung durch das Löschen von Ausgaben verletzt und „unbrauchbare“, geschwärzte Datenstichproben bereitgestellt hat.
