NYT, Büyük Telif Hakkı Davasında OpenAI'ı Delil Gizlemekle Suçluyor

The New York Times ile OpenAI arasındaki devam eden hukuk mücadelesi, yapay zeka devinin eğitim veri setlerine ilişkin delilleri kasıtlı olarak gizlediği iddialarıyla dramatik bir dönemece girdi. Bu tırmanış, davanın odağını telif hakkı ihlalinden yargısal delil toplama (discovery) sürecinin dürüstlüğüne kaydırma riski taşıyor.

Aldatıcı Veri Uygulamaları İddiaları

The New York Times ve The Daily News, OpenAI'ın hem eğitim külliyatını hem de müşteri sohbet günlüklerini arama konusundaki teknik kapasitesiyle ilgili olarak gerçeği yansıtmadığını iddia ediyor. İki yıldır süren dava boyunca OpenAI, devasa veri setlerini taramanın teknik olarak çok zahmetli olacağını ve kullanıcı gizliliğini tehlikeye atacağını savundu.

Ancak, OpenAI veri gizliliği mühendisi Vinnie Monaco'nun yakın zamanda verdiği bir ifade bu anlatıya meydan okudu. Monaco'nun, OpenAI'ın telif hakkıyla korunan gazetecilik eserlerini tespit etmek amacıyla eğitim külliyatında halihazırda dahili aramalar yaptığını ifşa ettiği iddia ediliyor. Dahası, ifade, OpenAI'ın potansiyel telif hakkı ihlalinin boyutunu dahili olarak değerlendirmek için yaklaşık 78 milyon kimliksizleştirilmiş ChatGPT konuşmasından oluşan bir veri tabanı topladığını öne sürüyor.

Project Giraffe ve "Bloom" Filtresi

Belki de en önemli teknik ifşaat, OpenAI tarafından uygulanan bir araç seti olan "Project Giraffe" ile ilgili. Davacılara göre, dava açıldıktan kısa bir süre sonra OpenAI, modelin telif hakkıyla korunan içeriği çıktıları halinde kelimesi kelimesine yeniden ürettiği "regurgitation" (bilgi kusma) durumlarını tespit etmek ve kaydetmek için bu projenin bir parçası olarak bir "Bloom" filtresi kullandı.

Project Giraffe'in varlığı, OpenAI'ın günlüklerindeki belirli içerik yeniden üretim örneklerini tespit etmenin imkansız bir görev olduğu yönündeki önceki duruşuyla çelişiyor. Davacılar, bu araçların OpenAI'ın sadece telif hakkı ihlallerini izleme kapasitesine sahip olduğunu değil, aynı zamanda bunları takip etmek için aktif olarak altyapı kurduğunu kanıtladığını savunuyor.

Veri Bütünlüğü ve Delil Toplama Üzerine Anlaşmazlıklar

Çatışma aynı zamanda mahkemeye sunulan verilerin kalitesi üzerinde yoğunlaştı. Davacılar başlangıçta 120 milyon sohbet günlüğünden oluşan bir örnek talep etmiş olsa da, OpenAI bu rakamı 20 milyona indirmeyi başardı. Örnek nihayet Aralık ayında sunulduğunda, mahkemenin aşırı karartma (redaction) nedeniyle verileri "kullanılamaz" bulduğu bildirildi.

NYT daha da ileri giderek, OpenAI'ın mahkeme tarafından verilen koruma emrini ihlal ederek milyarlarca ChatGPT çıktısını sildiğini ve sunulan örnekteki milyonlarca günlüğü değiştirdiğini iddia etti. Buna yanıt olarak OpenAI sözcüsü Drew Pusateri, tüm iddiaları reddederek Times'ı, hukuki davaları zayıfladıkça kullanıcı gizliliğini ihlal etmeye çalışmakla suçladı.

Bu Durum Yapay Zeka Endüstrisi İçin Neden Önemli?

Bu dava, üretken yapay zeka geliştirme süreçlerinin geleceği ve "adil kullanım"ın (fair use) hukuki sınırları için bir dönüm noktası niteliğinde. Eğer mahkeme, OpenAI'ın delilleri gizlediğine veya delil toplama sürecini manipüle ettiğine karar verirse, bu durum yapay zeka şirketlerinin eğitim metodolojilerini ve veri kökenlerini nasıl açıklamaları gerektiği konusunda bir emsal teşkil edebilir. Geliştiriciler ve yapay zeka kurucuları için dava sonucu, devasa veri alımı ile fikri mülkiyet haklarının kesiştiği noktada gereken şeffaflık düzeyini netleştirecektir.

Önemli Çıkarımlar

  • Dahili İzleme Araçları: İddialar, OpenAI'ın telif hakkıyla korunan içeriğin yeniden üretilmesini (regurgitation) aktif olarak takip etmek için "Project Giraffe" ve bir "Bloom" filtresi kullandığını öne sürüyor.
  • Çelişkili İfadeler: İfade kanıtları, OpenAI'ın eğitim verilerini arama konusunda teknik yeteneğe sahip olduğunu göstererek, daha önceki teknik zorluk iddialarıyla çelişiyor.
  • Delil Toplama Sürecinin Dürüstlüğü Tehlikede: Dava artık OpenAI'ın çıktıları silerek ve "kullanılamaz" derecede karartılmış veri örnekleri sunarak koruma emirlerini ihlal edip etmediği noktasına odaklanmış durumda.