صحيفة نيويورك تايمز تتهم OpenAI بإخفاء أدلة في محاكمة كبرى بشأن حقوق الطبع والنشر

اتخذت المعركة القانونية المستمرة بين صحيفة The New York Times وOpenAI منعطفاً دراماتيكياً، مع وجود اتهامات بأن عملاق الذكاء الاصطناعي تعمد إخفاء أدلة تتعلق بمجموعات بيانات التدريب الخاصة به. ويهدد هذا التصعيد بنقل تركيز الدعوى القضائية من انتهاك حقوق الطبع والنشر إلى نزاهة عملية الكشف القضائي (discovery process).

اتهامات بممارسات بيانات مضللة

تزعم صحيفة The New York Times وصحيفة The Daily News أن OpenAI لم تكن صادقة فيما يتعلق بقدرتها التقنية على البحث في كل من متن التدريب (training corpus) وسجلات دردشة العملاء. وطوال فترة التقاضي التي استمرت عامين، أكدت OpenAI أن البحث في مجموعات بياناتها الضخمة سيكون مرهقاً من الناحية التقنية وسيهدد خصوصية المستخدمين.

ومع ذلك، فقد تحدت شهادة حديثة أدلى بها مهندس خصوصية البيانات في OpenAI، Vinnie Monaco، هذه الرواية. حيث يُزعم أن Monaco كشف أن OpenAI كانت قد أجرت بالفعل عمليات بحث داخلية في متن التدريب الخاص بها لتحديد الأعمال الصحفية المحمية بحقوق الطبع والنشر تحديداً. علاوة على ذلك، تشير الشهادة إلى أن OpenAI قد جمعت قاعدة بيانات تضم حوالي 78 مليون محادثة من ChatGPT مجهولة الهوية لتقييم مدى انتهاك حقوق الطبع والنشر المحتمل داخلياً.

Project Giraffe ومرشح "Bloom"

ربما يكون الكشف التقني الأكثر أهمية هو "Project Giraffe"، وهو مجموعة من الأدوات التي طبقتها OpenAI. ووفقاً للمدعين، فإنه بعد وقت قصير من رفع الدعوى القضائية، استخدمت OpenAI مرشح "Bloom" كجزء من هذا المشروع للكشف عن حالات "الاجترار" (regurgitation) وتسجيلها — حيث يقوم النموذج بإعادة إنتاج محتوى محمي بحقوق الطبع والنشر حرفياً في مخرجاته.

إن وجود Project Giraffe يتناقض مع موقف OpenAI السابق بأن تحديد حالات معينة لإعادة إنتاج المحتوى ضمن سجلاتها كان مهمة مستحيلة. ويجادل المدعون بأن هذه الأدوات تثبت أن OpenAI لم تكن قادرة فقط على مراقبة انتهاك حقوق الطبع والنشر، بل كانت تعمل بنشاط على بناء بنية تحتية لتتبع ذلك.

نزاعات حول نزاهة البيانات وعملية الكشف

تركز الصراع أيضاً على جودة البيانات المقدمة للمحكمة. فبينما طلب المدعون في الأصل عينة مكونة من 120 مليون سجل دردشة، نجحت OpenAI في خفض هذا الرقم إلى 20 مليوناً. وعندما تم تقديم العينة أخيراً في ديسمبر، أفادت التقارير أن المحكمة وجدتها "غير قابلة للاستخدام" بسبب عمليات الحذف (redactions) المفرطة.

وقد ذهبت صحيفة NYT إلى أبعد من ذلك، حيث زعمت أن OpenAI حذفت مليارات المخرجات من ChatGPT في انتهاك لأمر الحفظ الصادر عن المحكمة، واستبدلت ملايين السجلات في العينة المقدمة. ورداً على ذلك، نفى المتحدث باسم OpenAI، Drew Pusateri، جميع الاتهامات، متهماً صحيفة Times بمحاولة انتهاك خصوصية المستخدم مع ضعف موقفهم القانوني.

لماذا يهم هذا قطاع الذكاء الاصطناعي

تُعد هذه القضية مؤشراً لمستقبل تطوير الذكاء الاصطناعي التوليدي والحدود القانونية لـ "الاستخدام العادل" (fair use). فإذا وجدت المحكمة أن OpenAI حجبَت أدلة أو تلاعبت بعملية الكشف، فقد يضع ذلك سابقة لكيفية مطالبة شركات الذكاء الاصطناعي بالإفصاح عن منهجيات التدريب وأصل البيانات (data lineage). وبالنسبة للمطورين ومؤسسي شركات الذكاء الاصطناعي، فإن النتيجة ستوضح مستوى الشفافية المطلوب عند التعامل مع التقاطع بين استيعاب البيانات الضخمة وحقوق الملكية الفكرية.

النقاط الرئيسية

  • أدوات المراقبة الداخلية: تشير الاتهامات إلى أن OpenAI استخدمت "Project Giraffe" ومرشح "Bloom" لتتبع عملية اجترار المحتوى المحمي بحقوق الطبع والنشر بشكل نشط.
  • شهادات متناقضة: تشير أدلة الشهادات إلى أن OpenAI كانت تمتلك القدرة التقنية للبحث في بيانات التدريب الخاصة بها، مما يتناقض مع ادعاءاتها السابقة بشأن العبء التقني.
  • نزاهة عملية الكشف على المحك: تعتمد الدعوى القضائية الآن على ما إذا كانت OpenAI قد انتهكت أوامر الحفظ عن طريق حذف المخرجات وتقديم عينات بيانات محذوفة "غير قابلة للاستخدام".