چرا این پرونده به دادگاه کشیده شد
ANI پس از مشاهده اینکه پاسخهای ChatGPT به پرسشهای مربوط به اخبار اخیر هند، مشابه مقالات خود این خبرگزاری است که در اوت و سپتامبر ۲۰۲۴ منتشر شده بودند، شکایت کرد. این خبرگزاری استدلال کرد که این مدل زبانی بزرگ در حال بازتولید متنهای دارای حق کپیرایت آنهاست؛ ادعایی که در صورت تأیید، OpenAI را مجبور میکرد فعالیت مدلهای خود را در هند متوقف کرده یا به شدت محدود کند.
OpenAI در پاسخ اعلام کرد که دو مدل ذکر شده — GPT-4 و مدل جدیدتر GPT-4o — بر اساس دادههایی با تاریخ قطع (cut-off) آوریل ۲۰۲۲ و آوریل ۲۰۲۴ آموزش دیدهاند. مقالات ANI پس از این تاریخها منتشر شده بودند، بنابراین نمیتوانستند در مجموعه دادههای آموزشی اصلی باشند. قاضی Amit Bansal اعلام کرد که این همپوشانی به احتمال زیاد ناشی از Retrieval-Augmented Generation (RAG) است که محتوای فعلی وب را بهصورت لحظهای (real-time) در پاسخ وارد میکند، و نه از طریق «به یاد آوردن» مقالات توسط مدل.
چرخش حقوقی: آموزش به مثابه «تحقیق»
اهمیت این پرونده در آن است که دادگاه استثنای کپیرایت هند برای «استفاده خصوصی یا شخصی، از جمله تحقیق» را به شکلی گسترده تفسیر کرد. هر دو طرف موافق بودند که OpenAI از مطالب ANI در مرحله اولیه آموزش استفاده کرده است، اما قاضی با این استفاده به عنوان یک امر «تحولآفرین» (transformative) برخورد کرد. به عبارت دیگر، مدل تنها دستور زبان، نحو (syntax) و الگوهای آماری را استخراج کرده و محتوای بیانی را دستنخورده باقی گذاشته است.
دادگاه دو شرط سختگیرانه تعیین کرد:
- نسخههای استفاده شده برای آموزش باید از منابع قانونی تهیه شوند، نه از آرشیوهای غیرقانونی (pirated) یا صفحات دارای پرداخت (paywalls) که کاربر به آنها دسترسی ندارد.
- مطالب باید در محیط خودِ توسعهدهنده باقی بمانند؛ آنها نباید منتشر یا توزیع شوند.
قاضی با اعمال یک آزمون انصاف سهمرحلهای، دریافت که استفاده OpenAI محدود به آموزش بوده است، هیچ شواهدی مبنی بر حفظ کردن عبارات کلمه به کلمه توسط مدل نیافت و خاطرنشان کرد که ANI دچار ضرر اقتصادی مستقیم نشده است، زیرا این دو شرکت در بخشهای متفاوتی از بازار فعالیت میکنند.
جایگاه این حکم در میان مجموعهای از احکام جهانی
موضع هند اکنون بازتابدهنده چندین پرونده در ایالات متحده است که از دیدگاه «تحولآفرین» نسبت به خروجیهای هوش مصنوعی حمایت میکنند. در پرونده Kadrey v. Meta، دادگاه حکم داد که متنهای تولید شدهای که کلمات دقیق را کپی نمیکنند، نقض کپیرایت محسوب نمیشوند؛ در حالی که تصمیم قدیمی Google Books، یک استثنای محدود برای «جستجو و نمایش» در پروژههای دیجیتالیسازی را به رسمیت شناخت. سایر دعاوی در ایالات متحده، مانند پرونده Raw Story، به دلیل عدم وجود آسیب قابل اثبات رد شدند، اما جنجال Anthropic به قضات یادآوری کرد که استفاده از دادههای غیرقانونی همچنان میتواند منجر به مسئولیت حقوقی شود.
در سراسر اروپا، نظرات به شدت متفاوت است. دادگاهها در مونیخ حکم دادهاند که بازتولید اشعار موسیقی که در وزنهای مدل (model weights) تعبیه شدهاند، مصداق نقض کپیرایت است، در حالی که یک دادگاه در لندن اخیراً ادعایی علیه Stability AI را با دلایل مشابه رد کرد. حکم دادگاه عالی دهلی نقطه داده دیگری را اضافه میکند: اگر آموزش به منابع قانونی محدود شود و خروجی یک کپی کلمه به کلمه نباشد، این فعالیت ممکن است تحت استثنای تحقیق قرار گیرد.
آنچه توسعهدهندگان باید زیر نظر داشته باشند
- RAG در مقابل آموزش – تمایز دادگاه بین «حفظ کردن» (آموزش) و بازیابی لحظهای (RAG) نشان میدهد که اختلافات آینده بر این موضوع متمرکز خواهد بود که آیا یک پاسخ از یک پایگاه دانش ایستا میآید یا بهصورت زنده از وب فراخوانی میشود. توسعهدهندگان ممکن است نیاز داشته باشند که این مرز را در مستندات محصول خود شفافتر کنند.
- منشأ منابع – الزام به استفاده از «منابع قانونی» میتواند شرکتها را وادار کند تا فرآیندهای مدیریت داده (data-curation) خود را با استفاده از قراردادها یا مجوزهایی که مشروع بودن هر بخش از متن را اثبات میکنند، سختگیرانهتر کنند.
- استفاده صرفاً داخلی – شرکتهایی که قصد تجاریسازی خروجیهای مدل را دارند، باید دادههای آموزشی را کاملاً داخلی نگه دارند. به اشتراک گذاشتن مجموعههای متنی خام (corpora) با شرکا یا عموم میتواند دفاعیه مبتنی بر «تحقیق» را تضعیف کند.
- آزمون آسیب اقتصادی – از آنجایی که دادگاه بر عدم وجود آسیب مالی مستقیم تأکید کرد، خواهانها باید ضرر ملموسی را نشان دهند، نه فقط کاهش احتمالی ارزش برند را.
- پاسخ قانونگذاری – قانونگذاران هند در حال نظارت بر بحثهای کپیرایت مرتبط با هوش مصنوعی هستند. هر اصلاحیهای که استثنای تحقیق را محدود کند، میتواند بهطور بازگشتی بر مدلهایی که قبلاً مستقر شدهاند تأثیر بگذارد و موجی از حسابرسیهای انطباق (compliance audits) را به راه بیندازد.
استدلال متقابلی که همچنان هوش مصنوعی را تهدید میکند
شکایت ANI یک نگرانی واقعی را برجسته کرد: با ماهرتر شدن LLMها در تکرار عبارتهای خاص، مرز بین استفاده «تحولآفرین» و «کپی» میتواند کمرنگ شود. منتقدان استدلال میکنند که RAG، اگرچه از نظر فنی یک عملکرد جستجو است، اما همچنان محتوای دارای کپیرایت را بدون اجازه نمایش میدهد که پتانسیل نقض حق «ارتباط با عموم» را دارد.
یک رویه با اثرات موجگونه در سراسر جهان
دادگاه عالی دهلی با طبقهبندی آموزش مدل به عنوان یک فعالیت پژوهشی مجاز، سیگنال داد که هند به طور خودکار مانع توسعه مدلهای زبانی بزرگ بر اساس قوانین حق تکثیر (کپیرایت) نخواهد شد، مشروط بر اینکه توسعهدهندگان به قانونی بودن منابع احترام گذاشته و فرآیند آموزش را به صورت داخلی نگه دارند. این تفسیر ممکن است شرکتها را تشویق کند تا با دانستن اینکه یک مانع حقوقی کلیدی کاهش یافته است، فعالیتهای خود را در هند گسترش دهند.
برای نهادهای تنظیمگر در سایر نقاط جهان، این حکم یک الگو ارائه میدهد: تعریف یک استثنای پژوهشی محدود و مستند، وضع استانداردهای شفاف برای منبعیابی، و الزام به مدیریت صرفاً داخلی دادههای آموزشی. کشورهایی که ادبیات مشابهی را اتخاذ کنند، میتوانند قطعیت لازم برای جذب سرمایه را به اکوسیستمهای هوش مصنوعی داخلی خود ببخشند.
خلاصه کلام: تصمیم دادگاه عالی دهلی به معنای دادن اختیار مطلق برای استخراج هر متنی جهت آموزش هوش مصنوعی نیست، اما این اصل را تثبیت میکند که طبق قوانین هند، آموزش منضبط و مطابق با قانون، در زمره پژوهش قرار میگیرد. این تفسیر میتواند به یک نقطه مرجع برای دادگاهها در سراسر جهان تبدیل شود، در حالی که آنها با این چالش دستوپنجه نرم میکنند که آیا آموزش ماشینها برای درک زبان، یک فعالیت علمی محافظتشده است یا تخطی از حقوق که در انتظار وقوع است.
