NYT Tuduh OpenAI Sembunyikan Bukti dalam Perbicaraan Hak Cipta Besar

Pertempuran undang-undang yang sedang berlangsung antara The New York Times dan OpenAI telah mengambil pusingan dramatik, dengan dakwaan bahawa gergasi AI tersebut sengaja mengaburkan bukti mengenai set data latihannya. Eskalasi ini mengancam untuk mengalihkan fokus saman tersebut daripada pelanggaran hak cipta kepada integriti proses penemuan kehakiman (judicial discovery process).

Dakwaan Amalan Data yang Menipu

The New York Times dan The Daily News mendakwa bahawa OpenAI tidak jujur mengenai kapasiti teknikalnya untuk mencari kedua-dua korpus latihan dan log sembang pelanggan. Sepanjang litigasi selama dua tahun ini, OpenAI menegaskan bahawa mencari set data besarnya akan membebankan dari segi teknikal dan akan menjejaskan privasi pengguna.

Walau bagaimanapun, satu deposisi terbaharu daripada jurutera privasi data OpenAI, Vinnie Monaco, telah mencabar naratif ini. Monaco didakwa mendedahkan bahawa OpenAI telah pun menjalankan carian dalaman terhadap korpus latihannya khusus untuk mengenal pasti karya kewartawanan yang mempunyai hak cipta. Tambahan pula, deposisi tersebut menunjukkan bahawa OpenAI telah mengumpul pangkalan data kira-kira 78 juta perbualan ChatGPT yang telah dinyahkenal pasti (de-identified) untuk menilai tahap potensi pelanggaran hak cipta secara dalaman.

Project Giraffe dan Penapis "Bloom"

Mungkin pendedahan teknikal yang paling signifikan melibatkan "Project Giraffe," satu set alatan yang dilaksanakan oleh OpenAI. Menurut plaintif, sejurus selepas saman difailkan, OpenAI menggunakan penapis "Bloom" sebagai sebahagian daripada projek ini untuk mengesan dan merekodkan kes "regurgitation"—di mana model tersebut menghasilkan semula kandungan berhak cipta secara verbatim dalam outputnya.

Kewujudan Project Giraffe bercanggah dengan pendirian terdahulu OpenAI bahawa mengenal pasti kes khusus penghasilan semula kandungan dalam lognya adalah tugas yang mustahil dilakukan. Plaintif berhujah bahawa alatan ini membuktikan OpenAI bukan sahaja mampu memantau pelanggaran hak cipta, malah sedang aktif membina infrastruktur untuk menjejaki perkara tersebut.

Pertikaian Mengenai Integriti Data dan Penemuan

Konflik ini juga tertumpu kepada kualiti data yang diberikan kepada mahkamah. Walaupun plaintif pada asalnya meminta sampel sebanyak 120 juta log sembang, OpenAI telah merundingkan angka tersebut kepada 20 juta. Apabila sampel tersebut akhirnya diserahkan pada bulan Disember, mahkamah dilaporkan mendapati ia "tidak boleh digunakan" disebabkan oleh pemadaman (redaction) yang berlebihan.

NYT telah bertindak lebih jauh dengan mendakwa bahawa OpenAI telah memadamkan berbilion output ChatGPT yang melanggar perintah pemeliharaan (preservation order) mahkamah dan menggantikan berjuta-juta log dalam sampel yang disediakan. Sebagai maklum balas, jurucakap OpenAI, Drew Pusateri, telah menafikan semua dakwaan tersebut dan menuduh Times cuba menceroboh privasi pengguna memandangkan kes undang-undang mereka semakin lemah.

Mengapa Ini Penting untuk Industri AI

Kes ini merupakan penanda aras (bellwether) bagi masa depan pembangunan AI generatif dan sempadan undang-undang "penggunaan adil" (fair use). Jika mahkamah mendapati bahawa OpenAI menyembunyikan bukti atau memanipulasi penemuan, ia boleh menetapkan preseden tentang bagaimana syarikat AI dikehendaki mendedahkan metodologi latihan dan salasilah data (data lineage) mereka. Bagi pembangun dan pengasas AI, keputusan ini akan menjelaskan tahap ketelusan yang diperlukan apabila mengemudi persimpangan antara pengambilan data besar-besaran dan hak harta intelek.

Ringkasan Utama

  • Alatan Pemantauan Dalaman: Dakwaan menunjukkan OpenAI menggunakan "Project Giraffe" dan penapis "Bloom" untuk menjejaki pengeluaran semula kandungan berhak cipta secara aktif.
  • Testimoni yang Bercanggah: Bukti deposisi menunjukkan OpenAI mempunyai keupayaan teknikal untuk mencari data latihannya, sekali gus bercanggah dengan dakwaan terdahulu mengenai beban teknikal.
  • Integriti Penemuan Terancam: Saman ini kini bergantung kepada sama ada OpenAI melanggar perintah pemeliharaan dengan memadamkan output dan menyediakan sampel data yang telah dipadamkan (redacted) yang "tidak boleh digunakan".