Mengapa kasus ini sampai ke pengadilan
ANI mengajukan gugatan setelah menyadari bahwa jawaban ChatGPT terhadap pertanyaan mengenai berita terbaru di India menyerupai artikelnya sendiri yang diterbitkan pada Agustus dan September 2024. Agensi tersebut berargumen bahwa model bahasa besar tersebut mereproduksi teks berhak ciptanya, sebuah klaim yang, jika dikabulkan, akan memaksa OpenAI untuk menghentikan atau membatasi secara ketat model-modelnya di India.
OpenAI menjawab bahwa kedua model yang dikutip—GPT-4 dan GPT-4o yang lebih baru—dilatih menggunakan data dengan tanggal batas (cut-off) April 2022 dan April 2024. Artikel ANI muncul setelah tanggal-tanggal tersebut, sehingga tidak mungkin ada dalam set pelatihan asli. Hakim Amit Bansal menyatakan bahwa kemiripan tersebut kemungkinan besar berasal dari Retrieval-Augmented Generation (RAG), yang menarik konten web terkini ke dalam respons secara real-time, bukan karena model tersebut "mengingat" artikel-artikel tersebut.
Titik balik hukum: pelatihan sebagai "penelitian"
Kasus ini penting karena pengadilan menafsirkan pengecualian hak cipta India untuk "penggunaan pribadi atau personal, termasuk penelitian" secara luas. Kedua belah pihak sepakat bahwa OpenAI menggunakan materi ANI selama fase pelatihan awal, tetapi hakim menganggap penggunaan tersebut sebagai sesuatu yang "transformatif". Dengan kata lain, model tersebut hanya mengekstrak tata bahasa, sintaksis, dan pola statistik, tanpa menyentuh konten ekspresifnya.
Pengadilan menetapkan dua kondisi ketat:
- Salinan yang digunakan untuk pelatihan harus berasal dari sumber yang sah, bukan dari arsip bajakan atau paywall yang tidak dapat diakses oleh pengguna.
- Materi tersebut harus tetap berada di dalam lingkungan pengembang sendiri; tidak boleh dipublikasikan atau didistribusikan.
Dengan menerapkan uji keadilan tiga bagian, hakim menemukan bahwa penggunaan OpenAI terbatas pada pelatihan, tidak menemukan bukti bahwa model tersebut menghafal kutipan kata demi kata, dan mencatat bahwa ANI tidak menderita kerugian ekonomi langsung karena kedua perusahaan beroperasi di segmen pasar yang berbeda.
Bagaimana hal ini sesuai dengan rangkaian putusan global
Sikap India kini mencerminkan beberapa kasus di AS yang mendukung pandangan transformatif terhadap output AI. Dalam kasus Kadrey v. Meta, pengadilan memutuskan bahwa teks yang dihasilkan yang tidak menyalin kata-kata persis bukanlah pelanggaran, sementara keputusan Google Books yang sudah lama ada mengakui pengecualian "pencarian-dan-tampilan" yang terbatas untuk proyek digitalisasi. Gugatan AS lainnya, seperti kasus Raw Story, ditolak karena kurangnya bukti kerugian yang nyata, tetapi kontroversi Anthropic mengingatkan para hakim bahwa penggunaan data bajakan tetap dapat memicu tanggung jawab hukum.
Di seluruh Eropa, pendapat sangat beragam. Pengadilan di Munich telah memutuskan bahwa mereproduksi lirik yang tertanam dalam bobot model (model weights) merupakan pelanggaran, sementara sebuah tribunal di London baru-baru ini menolak klaim terhadap Stability AI dengan alasan serupa. Putusan Pengadilan Tinggi Delhi menambah poin data lainnya: jika pelatihan terbatas pada sumber yang sah dan outputnya bukan salinan kata demi kata, aktivitas tersebut dapat termasuk dalam pengecualian penelitian.
Apa yang harus diperhatikan oleh pengembang
- RAG vs. pelatihan – Perbedaan yang ditetapkan pengadilan antara "penghafalan" (pelatihan) dan pengambilan real-time (RAG) menunjukkan bahwa sengketa di masa depan akan berfokus pada apakah sebuah jawaban berasal dari basis pengetahuan statis atau diambil secara langsung dari web. Pengembang mungkin perlu memperjelas batasan tersebut dalam dokumentasi produk.
- Asal-usul sumber – Persyaratan "sumber yang sah" dapat mendorong perusahaan untuk memperketat alur kurasi data, menggunakan kontrak atau lisensi yang membuktikan bahwa setiap potongan teks adalah sah.
- Penggunaan internal saja – Perusahaan yang berencana mengomersialkan output model harus menjaga data pelatihan tetap bersifat internal secara ketat. Berbagi korpus mentah dengan mitra atau publik dapat mengikis pembelaan berbasis penelitian.
- Uji kerugian ekonomi – Karena pengadilan menekankan tidak adanya cedera finansial langsung, penggugat perlu menunjukkan kerugian nyata, bukan sekadar persepsi penurunan nilai merek (brand dilution).
- Respons legislatif – Pembuat undang-undang di India sedang memantau debat hak cipta terkait AI. Amandemen apa pun yang mempersempit pengecualian penelitian dapat berdampak secara retroaktif pada model yang sudah diterapkan, yang memicu gelombang audit kepatuhan.
Argumen tandingan yang masih menghantui AI
Keluhan ANI menyoroti kekhawatiran yang nyata: seiring LLM menjadi lebih mahir dalam meniru frasa tertentu, garis antara penggunaan "transformatif" dan "salinan" dapat menjadi kabur. Kritikus berpendapat bahwa RAG, meskipun secara teknis adalah fungsi pencarian, tetap memunculkan konten berhak cipta tanpa izin, yang berpotensi melanggar hak "komunikasi kepada publik".
Sebuah preseden dengan efek riak di seluruh dunia
Dengan mengklasifikasikan pelatihan model sebagai aktivitas penelitian yang diizinkan, Pengadilan Tinggi Delhi memberi sinyal bahwa India tidak akan secara otomatis memblokir pengembangan model bahasa besar atas dasar hak cipta, asalkan pengembang menghormati legalitas sumber dan menjaga proses pelatihan tetap bersifat internal. Penafsiran tersebut dapat mendorong perusahaan untuk memperluas operasi mereka di India, karena mengetahui bahwa hambatan hukum utama telah melunak.
Bagi regulator di tempat lain, putusan ini menawarkan sebuah acuan: tetapkan pengecualian penelitian yang sempit dan terdokumentasi dengan baik, terapkan standar sumber yang jelas, dan wajibkan penanganan data pelatihan yang hanya bersifat internal. Negara-negara yang mengadopsi bahasa serupa dapat memberikan kepastian yang dibutuhkan oleh ekosistem AI domestik mereka untuk menarik investasi.
Intinya: Keputusan Pengadilan Tinggi Delhi tidak memberikan kebebasan penuh untuk melakukan scraping teks apa pun demi pelatihan AI, tetapi menetapkan bahwa, di bawah hukum India, pelatihan yang disiplin dan patuh hukum memenuhi syarat sebagai penelitian. Interpretasi tersebut dapat menjadi titik acuan bagi pengadilan di seluruh dunia saat mereka bergulat dengan pertanyaan apakah mengajarkan mesin untuk memahami bahasa merupakan aktivitas ilmiah yang dilindungi atau sebuah pelanggaran yang tinggal menunggu waktu.
