لماذا وصلت القضية إلى المحكمة

رفعت وكالة ANI دعوى قضائية بعد ملاحظتها أن إجابات ChatGPT على الاستفسارات المتعلقة بالأخبار الهندية الأخيرة تشبه مقالاتها الخاصة المنشورة في أغسطس وسبتمبر 2024. وجادلت الوكالة بأن النموذج اللغوي الكبير يعيد إنتاج نصوصها المحمية بحقوق الطبع والنشر، وهو ادعاء إذا تم تأييده، فسيجبر OpenAI على وقف نماذجها في الهند أو تقييدها بشدة.

ردت OpenAI بأن النموذجين المذكورين — GPT-4 والنموذج الأحدث GPT-4o — قد تم تدريبهما على بيانات لها تواريخ انقطاع في أبريل 2022 وأبريل 2024. وبما أن مقالات ANI ظهرت بعد تلك التواريخ، فلم يكن من الممكن أن تكون ضمن مجموعة التدريب الأصلية. وقال القاضي Amit Bansal إن التداخل من المرجح أن يكون ناتجًا عن تقنية "التوليد المعزز بالاسترجاع" (RAG)، التي تسحب المحتوى الحالي من الويب في الوقت الفعلي، وليس من "تذكر" النموذج للمقالات.

التحول القانوني: التدريب بوصفه "بحثًا"

تكتسب القضية أهمية لأن المحكمة فسرت استثناء حقوق الطبع والنشر في الهند لـ "الاستخدام الخاص أو الشخصي، بما في ذلك البحث" بشكل واسع. واتفق الطرفان على أن OpenAI استخدمت مواد ANI خلال مرحلة التدريب الأولية، لكن القاضي تعامل مع هذا الاستخدام على أنه "تحويلي" (transformative). وبعبارة أخرى، استخلص النموذج فقط القواعد النحوية وبنية الجملة والأنماط الإحصائية، تاركًا المحتوى التعبيري دون تغيير.

وضعت المحكمة شرطين صارمين:

  • يجب أن تأتي النسخ المستخدمة للتدريب من مصادر قانونية، وليس من أرشيفات مقرصنة أو جدران دفع (paywalls) لا يمكن للمستخدم الوصول إليها.
  • يجب أن تظل المواد داخل بيئة المطور الخاصة؛ ولا يمكن نشرها أو توزيعها.

ومن خلال تطبيق اختبار عدالة ثلاثي الأجزاء، وجد القاضي أن استخدام OpenAI اقتصر على التدريب، ولم يجد دليلًا على أن النموذج حفظ نصوصًا حرفية، وأشار إلى أن ANI لم تعانِ من خسارة اقتصادية مباشرة لأن الشركتين تعملان في قطاعات سوقية مختلفة.

كيف يتناسب هذا مع مجموعة من الأحكام العالمية

يعكس موقف الهند الآن عدة قضايا في الولايات المتحدة تدعم الرؤية التحويلية لمخرجات الذكاء الاصطناعي. ففي قضية Kadrey v. Meta، قضت المحكمة بأن النصوص المولدة التي لا تنسخ الكلمات بدقة لا تعد انتهاكًا، بينما اعترف قرار Google Books طويل الأمد باستثناء محدود لـ "البحث والعرض" لمشاريع الرقمنة. كما رُفضت دعاوى أمريكية أخرى، مثل قضية Raw Story، لعدم وجود ضرر يمكن إثباته، لكن الجدل حول Anthropic ذكر القضاة بأن استخدام البيانات المقرصنة لا يزال يمكن أن يؤدي إلى المسؤولية القانونية.

في جميع أنحاء أوروبا، تتباين الآراء بشكل حاد. فقد حكمت المحاكم في ميونيخ بأن إعادة إنتاج كلمات الأغاني المضمنة في أوزان النموذج (model weights) يعد انتهاكًا، بينما رفضت محكمة في لندن مؤخرًا دعوى ضد Stability AI بناءً على أسس مماثلة. ويضيف حكم محكمة دلهي العليا نقطة بيانات أخرى: إذا كان التدريب مقتصرًا على المصادر القانونية ولم يكن المخرج نسخة حرفية، فقد تندرج هذه الأنشطة تحت استثناء البحث.

ما يجب على المطورين مراقبته

  • RAG مقابل التدريب – يشير تمييز المحكمة بين "الحفظ" (التدريب) والاسترجاع في الوقت الفعلي (RAG) إلى أن النزاعات المستقبلية ستركز على ما إذا كانت الإجابة تأتي من قاعدة معرفية ثابتة أم يتم جلبها مباشرة من الويب. قد يحتاج المطورون إلى جعل هذا الخط أكثر وضوحًا في وثائق المنتج.
  • مصدر البيانات – قد يدفع شرط "المصادر القانونية" الشركات إلى تشديد عمليات تنسيق البيانات، باستخدام عقود أو تراخيص تثبت أن كل جزء من النص شرعي.
  • الاستخدام الداخلي فقط – يجب على الشركات التي تخطط لتسويق مخرجات النماذج تجارياً إبقاء بيانات التدريب داخلية تمامًا. إن مشاركة مجموعات البيانات الخام مع الشركاء أو الجمهور قد تضعف الدفاع القائم على البحث.
  • اختبار الضرر الاقتصادي – نظرًا لأن المحكمة أكدت على غياب الضرر المالي المباشر، فسيحتاج المدعون إلى إظهار خسارة ملموسة، وليس مجرد تراجع متصور في قيمة العلامة التجارية.
  • الاستجابة التشريعية – يراقب المشرعون الهنود المناقشات المتعلقة بحقوق الطبع والنشر في مجال الذكاء الاصطناعي. وأي تعديل يضيق نطاق استثناء البحث قد يؤثر بأثر رجعي على النماذج المنشورة بالفعل، مما قد يؤدي إلى موجة من عمليات تدقيق الامتثال.

الحجة المضادة التي لا تزال تطارد الذكاء الاصطناعي

سلطت شكوى ANI الضوء على مخاوف حقيقية: فمع زيادة براعة النماذج اللغوية الكبيرة (LLMs) في محاكاة صياغات محددة، يمكن أن يختفي الخط الفاصل بين الاستخدام "التحويلي" و"النسخ". ويجادل النقاد بأن تقنية RAG، رغم أنها وظيفة بحث من الناحية التقنية، لا تزال تظهر محتوى محميًا بحقوق الطبع والنشر دون إذن، مما قد ينتهك حق "التواصل مع الجمهور".

سابقة ذات آثار عالمية متتالية

من خلال تصنيف تدريب النماذج كنشاط بحثي مسموح به، أعطت محكمة دلهي العليا إشارة إلى أن الهند لن تمنع تلقائياً تطوير نماذج اللغة الكبيرة بناءً على حقوق الطبع والنشر، شريطة أن يحترم المطورون قانونية المصادر وأن يظل التدريب داخلياً. وقد يشجع هذا التفسير الشركات على توسيع عملياتها في الهند، لعلمها بأن عقبة قانونية رئيسية قد تلاشت.

وبالنسبة للجهات التنظيمية في أماكن أخرى، يقدم هذا الحكم نموذجاً: تحديد استثناء بحثي ضيق وموثق جيداً، وفرض معايير واضحة للحصول على المصادر، والمطالبة بالتعامل مع بيانات التدريب داخلياً فقط. ويمكن للدول التي تتبنى لغة مماثلة أن تمنح أنظمتها البيئية المحلية للذكاء الاصطناعي اليقين اللازم لجذب الاستثمارات.

الخلاصة: لا يمنح قرار محكمة دلهي العليا صكاً على بياض لكشط أي نص لتدريب الذكاء الاصطناعي، ولكنه يقرر أنه بموجب القانون الهندي، فإن التدريب المنضبط والمتوافق مع القانون يُعد بحثاً. وقد يصبح هذا التفسير نقطة مرجعية للمحاكم في جميع أنحاء العالم وهي تصارع مسألة ما إذا كان تعليم الآلات فهم اللغة نشاطاً أكاديمياً محمياً أم انتهاكاً وشيك الوقوع.