Mengapa kes ini dibawa ke mahkamah
ANI menyaman selepas menyedari bahawa jawapan ChatGPT kepada pertanyaan mengenai berita terkini di India menyerupai artikelnya sendiri yang diterbitkan pada Ogos dan September 2024. Agensi tersebut berhujah bahawa model bahasa besar itu menghasilkan semula teks hak ciptanya, satu dakwaan yang, jika dikekalkan, akan memaksa OpenAI untuk menghentikan atau menyekat modelnya secara besar-besaran di India.
OpenAI menjawab bahawa dua model yang dinyatakan—GPT-4 dan GPT-4o yang lebih baharu—dilatih menggunakan data dengan tarikh tamat pada April 2022 dan April 2024. Artikel ANI muncul selepas tarikh tersebut, jadi ia tidak mungkin berada dalam set latihan asal. Hakim Amit Bansal berkata pertindihan tersebut berkemungkinan besar berpunca daripada Retrieval-Augmented Generation (RAG), yang menarik kandungan web semasa ke dalam respons secara masa nyata, bukannya daripada model yang "mengingat" artikel tersebut.
Peralihan undang-undang: latihan sebagai “penyelidikan”
Kes ini penting kerana mahkamah mentafsir pengecualian hak cipta India untuk “penggunaan peribadi atau persendirian, termasuk penyelidikan” secara luas. Kedua-dua pihak bersetuju bahawa OpenAI menggunakan bahan ANI semasa fasa latihan awal, tetapi hakim menganggap penggunaan tersebut sebagai “transformatif.” Dalam erti kata lain, model tersebut hanya mengekstrak tatabahasa, sintaksis dan corak statistik, tanpa menyentuh kandungan ekspresifnya.
Mahkamah menetapkan dua syarat ketat:
- Salinan yang digunakan untuk latihan mesti datang daripada sumber yang sah, bukan arkib cetak rompak atau dinding berbayar (paywall) yang tidak boleh diakses oleh pengguna.
- Bahan tersebut mesti kekal di dalam persekitaran pembangun sendiri; ia tidak boleh diterbitkan atau diedarkan.
Dengan menggunakan ujian keadilan tiga bahagian, hakim mendapati penggunaan OpenAI terhad kepada latihan, tidak melihat sebarang bukti model tersebut menghafal petikan secara verbatim, dan menyatakan bahawa ANI tidak mengalami kerugian ekonomi secara langsung kerana kedua-dua firma beroperasi dalam segmen pasaran yang berbeza.
Bagaimana ini sesuai dalam rangkaian keputusan global
Pendirian India kini mencerminkan beberapa kes di AS yang menyokong pandangan transformatif terhadap output AI. Dalam Kadrey v. Meta, mahkamah memutuskan bahawa teks yang dihasilkan yang tidak menyalin perkataan yang tepat tidak melanggar hak cipta, manakala keputusan Google Books yang telah lama wujud mengiktiraf pengecualian “carian-dan-paparan” yang terhad untuk projek pendigitalan. Saman AS yang lain, seperti kes Raw Story, telah ditolak kerana kekurangan bukti kemudaratan, tetapi kontroversi Anthropic mengingatkan hakim bahawa penggunaan data cetak rompak masih boleh mencetuskan liabiliti.
Di seluruh Eropah, pendapat sangat berbeza. Mahkamah di Munich telah memutuskan bahawa menghasilkan semula lirik yang tertanam dalam pemberat model (model weights) adalah satu pelanggaran, manakala sebuah tribunal di London baru-baru ini menolak tuntutan terhadap Stability AI atas alasan yang sama. Keputusan Mahkamah Tinggi Delhi menambah satu lagi titik data: jika latihan dihadkan kepada sumber yang sah dan output bukan salinan verbatim, aktiviti tersebut mungkin jatuh di bawah pengecualian penyelidikan.
Apa yang perlu diperhatikan oleh pembangun
- RAG vs. latihan – Perbezaan mahkamah antara “penghafalan” (latihan) dan pengambilan masa nyata (RAG) menunjukkan bahawa pertikaian masa hadapan akan tertumpu pada sama ada jawapan datang daripada pangkalan pengetahuan statik atau diambil secara langsung dari web. Pembangun mungkin perlu menjelaskan garis pemisah tersebut dalam dokumentasi produk.
- Asal-usul sumber – Keperluan “sumber yang sah” boleh mendorong firma untuk memperketat saluran kurasi data, menggunakan kontrak atau lesen yang membuktikan setiap bahagian teks adalah sah.
- Penggunaan dalaman sahaja – Syarikat yang merancang untuk mengkomersialkan output model mesti menyimpan data latihan secara dalaman sahaja. Berkongsi korpus mentah dengan rakan kongsi atau orang awam boleh menghakis pembelaan penyelidikan.
- Ujian kemudaratan ekonomi – Oleh kerana mahkamah menekankan ketiadaan kecederaan kewangan secara langsung, penuntut perlu menunjukkan kerugian konkrit, bukan sekadar persepsi pencairan jenama.
- Respons perundangan – Penggubal undang-undang India sedang memantau perdebatan hak cipta berkaitan AI. Sebarang pindaan yang mengecilkan pengecualian penyelidikan boleh memberi kesan secara retrospektif kepada model yang telah digunakan, yang seterusnya mencetuskan gelombang audit pematuhan.
Hujah balas yang masih menghantui AI
Aduan ANI menonjolkan kebimbangan yang nyata: apabila LLM menjadi lebih mahir dalam mengulangi frasa tertentu, garis antara penggunaan “transformatif” dan “salinan” boleh menjadi kabur. Pengkritik berhujah bahawa RAG, walaupun secara teknikalnya merupakan fungsi carian, masih memaparkan kandungan hak cipta tanpa kebenaran, yang berpotensi melanggar hak “komunikasi kepada orang awam.”
Satu preseden dengan kesan riak di seluruh dunia
Dengan mengklasifikasikan latihan model sebagai aktiviti penyelidikan yang dibenarkan, Mahkamah Tinggi Delhi memberi isyarat bahawa India tidak akan menyekat pembangunan model bahasa besar secara automatik atas alasan hak cipta, asalkan pembangun menghormati kesahihan sumber dan mengekalkan latihan secara dalaman. Tafsiran tersebut mungkin menggalakkan syarikat untuk memperluas operasi mereka di India, memandangkan halangan undang-undang utama telah diringankan.
Bagi pengawal selia di tempat lain, keputusan tersebut menawarkan satu templat: tetapkan pengecualian penyelidikan yang sempit dan didokumentasikan dengan baik, kenakan piawaian sumber yang jelas, dan wajibkan pengendalian data latihan secara dalaman sahaja. Negara-negara yang menggunakan bahasa yang serupa boleh memberikan ekosistem AI domestik mereka kepastian yang diperlukan untuk menarik pelaburan.
Kesimpulannya: Keputusan Mahkamah Tinggi Delhi tidak memberikan kebenaran mutlak untuk mengikis sebarang teks bagi latihan AI, tetapi ia menetapkan bahawa, di bawah undang-undang India, latihan yang berdisiplin dan mematuhi undang-undang layak dianggap sebagai penyelidikan. Tafsiran tersebut boleh menjadi titik rujukan bagi mahkamah di seluruh dunia semasa mereka bergelut dengan persoalan sama ada mengajar mesin untuk memahami bahasa merupakan aktiviti ilmiah yang dilindungi atau satu pelanggaran yang bakal berlaku.
