NYT Menuduh OpenAI Menyembunyikan Bukti dalam Persidangan Hak Cipta Besar

Pertempuran hukum yang sedang berlangsung antara The New York Times dan OpenAI telah mengalami perubahan dramatis, dengan tuduhan bahwa raksasa AI tersebut sengaja mengaburkan bukti terkait kumpulan data pelatihannya. Eskalasi ini mengancam akan mengalihkan fokus gugatan dari pelanggaran hak cipta ke integritas proses penemuan bukti (discovery) dalam peradilan.

Tuduhan Praktik Data yang Menyesatkan

The New York Times dan The Daily News mengklaim bahwa OpenAI tidak jujur mengenai kapasitas teknisnya untuk mencari baik korpus pelatihan maupun log obrolan pelanggan. Sepanjang litigasi selama dua tahun ini, OpenAI bersikeras bahwa pencarian pada kumpulan data masifnya akan menjadi beban teknis dan akan mengompromikan privasi pengguna.

Namun, deposisi terbaru dari insinyur privasi data OpenAI, Vinnie Monaco, telah menyanggah narasi tersebut. Monaco diduga mengungkapkan bahwa OpenAI telah melakukan pencarian internal pada korpus pelatihannya khusus untuk mengidentifikasi karya jurnalistik yang dilindungi hak cipta. Selain itu, deposisi tersebut menunjukkan bahwa OpenAI telah mengumpulkan basis data berisi sekitar 78 juta percakapan ChatGPT yang telah dianonimkan untuk menilai sejauh mana potensi pelanggaran hak cipta secara internal.

Project Giraffe dan Filter "Bloom"

Mungkin pengungkapan teknis yang paling signifikan melibatkan "Project Giraffe," sebuah rangkaian alat yang diterapkan oleh OpenAI. Menurut penggugat, sesaat setelah gugatan diajukan, OpenAI menggunakan filter "Bloom" sebagai bagian dari proyek ini untuk mendeteksi dan mencatat contoh "regurgitasi"—di mana model tersebut mereproduksi konten berhak cipta secara kata demi kata dalam outputnya.

Keberadaan Project Giraffe bertentangan dengan sikap OpenAI sebelumnya yang menyatakan bahwa mengidentifikasi contoh spesifik reproduksi konten dalam lognya adalah tugas yang mustahil dilakukan. Para penggugat berpendapat bahwa alat-alat ini membuktikan OpenAI tidak hanya mampu memantau pelanggaran hak cipta, tetapi juga secara aktif membangun infrastruktur untuk melacaknya.

Perselisihan Mengenai Integritas Data dan Penemuan Bukti

Konflik ini juga berpusat pada kualitas data yang diberikan kepada pengadilan. Meskipun penggugat awalnya meminta sampel sebanyak 120 juta log obrolan, OpenAI menegosiasikan angka tersebut menjadi 20 juta. Ketika sampel tersebut akhirnya diserahkan pada bulan Desember, pengadilan dilaporkan menganggapnya "tidak dapat digunakan" karena sensor (redaksi) yang berlebihan.

NYT melangkah lebih jauh dengan menuduh bahwa OpenAI menghapus miliaran output ChatGPT yang melanggar perintah preservasi pengadilan dan mengganti jutaan log dalam sampel yang diberikan. Menanggapi hal tersebut, juru bicara OpenAI Drew Pusateri membantah semua tuduhan, dan menuduh Times mencoba melanggar privasi pengguna seiring melemahnya kasus hukum mereka.

Mengapa Ini Penting bagi Industri AI

Kasus ini merupakan tolok ukur bagi masa depan pengembangan AI generatif dan batasan hukum dari "fair use" (penggunaan wajar). Jika pengadilan menemukan bahwa OpenAI menahan bukti atau memanipulasi proses penemuan bukti, hal ini dapat menetapkan preseden tentang bagaimana perusahaan AI diwajibkan untuk mengungkapkan metodologi pelatihan dan asal-usul data mereka. Bagi para pengembang dan pendiri AI, hasilnya akan memperjelas tingkat transparansi yang diperlukan saat menavigasi persimpangan antara penyerapan data masif dan hak kekayaan intelektual.

Poin-Poin Penting

  • Alat Pemantauan Internal: Tuduhan menunjukkan bahwa OpenAI menggunakan "Project Giraffe" dan filter "Bloom" untuk secara aktif melacak regurgitasi konten berhak cipta.
  • Kesaksian yang Bertentangan: Bukti deposisi menunjukkan bahwa OpenAI memiliki kemampuan teknis untuk mencari data pelatihannya, yang bertentangan dengan klaim sebelumnya mengenai beban teknis.
  • Integritas Penemuan Bukti Terancam: Gugatan ini kini bergantung pada apakah OpenAI melanggar perintah preservasi dengan menghapus output dan memberikan sampel data yang disensor dan "tidak dapat digunakan".