نیویورک تایمز OpenAI را به پنهان کردن شواهد در دادگاه بزرگ حق تکثیر متهم کرد
نبرد حقوقی جاری میان The New York Times و OpenAI تحول دراماتیکی یافته است؛ با این اتهام که این غول هوش مصنوعی عامدانه شواهد مربوط به مجموعهدادههای آموزشی خود را پنهان کرده است. این تشدید تنش تهدید میکند که تمرکز این شکایت از نقض حق تکثیر (کپیرایت) به سلامت فرآیند کشف مدارک قضایی تغییر یابد.
اتهامات مربوط به شیوههای فریبکارانه دادهای
The New York Times و The Daily News ادعا میکنند که OpenAI در مورد توانایی فنی خود برای جستجو در پیکره آموزشی و همچنین گزارشهای چت مشتریان، عدم صداقت به خرج داده است. در طول این دادگاه دو ساله، OpenAI همواره مدعی بوده که جستجو در مجموعهدادههای عظیم خود از نظر فنی دشوار است و حریم خصوصی کاربران را به خطر میاندازد.
با این حال، شهادت اخیر وینی موناکو (Vinnie Monaco)، مهندس حریم خصوصی دادهها در OpenAI، این روایت را به چالش کشیده است. گفته میشود موناکو فاش کرده که OpenAI پیش از این جستجوهای داخلی در پیکره آموزشی خود را بهطور مشخص برای شناسایی آثار روزنامهنگاری دارای حق تکثیر انجام داده است. علاوه بر این، این شهادت نشان میدهد که OpenAI پایگاه دادهای شامل تقریباً ۷۸ میلیون گفتگوی بدون هویت ChatGPT را برای ارزیابی داخلی میزان نقض احتمالی حق تکثیر جمعآوری کرده است.
پروژه Giraffe و فیلتر "Bloom"
شاید مهمترین افشاگری فنی مربوط به "Project Giraffe" باشد، مجموعهای از ابزارها که توسط OpenAI پیادهسازی شده است. طبق گفته شاکیان، مدت کوتاهی پس از ثبت شکایت، OpenAI از یک فیلتر "Bloom" به عنوان بخشی از این پروژه برای شناسایی و ثبت موارد "بازگویی" (regurgitation) استفاده کرد؛ یعنی زمانی که مدل، محتوای دارای حق تکثیر را عیناً در خروجیهای خود بازتولید میکند.
وجود Project Giraffe با موضع قبلی OpenAI مبنی بر اینکه شناسایی موارد خاص بازتولید محتوا در گزارشهای خود یک کار غیرممکن است، در تضاد است. شاکیان استدلال میکنند که این ابزارها ثابت میکنند OpenAI نه تنها قادر به نظارت بر نقض حق تکثیر بوده، بلکه فعالانه در حال ساخت زیرساختهایی برای ردیابی آن بوده است.
اختلافات بر سر سلامت دادهها و کشف مدارک
این درگیری همچنین بر کیفیت دادههای ارائهشده به دادگاه متمرکز شده است. در حالی که شاکیان در ابتدا درخواست نمونهای شامل ۱۲۰ میلیون گزارش چت را داشتند، OpenAI این رقم را به ۲۰ میلیون کاهش داد. گزارش شده است زمانی که این نمونه در ماه دسامبر ارائه شد، دادگاه آن را به دلیل حذفیات (redactions) بیش از حد، "غیرقابل استفاده" تشخیص داد.
نیویورک تایمز فراتر رفته و ادعا کرده است که OpenAI میلیاردها خروجی ChatGPT را برخلاف دستور دادگاه برای حفظ مدارک، حذف کرده و میلیونها گزارش را در نمونه ارائهشده جایگزین کرده است. در پاسخ، درو پوساتری (Drew Pusateri)، سخنگوی OpenAI، تمامی اتهامات را رد کرده و تایمز را متهم کرده است که با تضعیف پرونده حقوقی خود، سعی در نقض حریم خصوصی کاربران دارد.
چرا این موضوع برای صنعت هوش مصنوعی اهمیت دارد
این پرونده شاخصی برای آینده توسعه هوش مصنوعی مولد و مرزهای قانونی "استفاده منصفانه" (fair use) است. اگر دادگاه تشخیص دهد که OpenAI مدارک را پنهان کرده یا در فرآیند کشف مدارک دستکاری انجام داده است، میتواند الگویی برای نحوه افشای روشهای آموزشی و منشأ دادهها توسط شرکتهای هوش مصنوعی ایجاد کند. برای توسعهدهندگان و بنیانگذاران هوش مصنوعی، نتیجه این پرونده سطح شفافیت مورد نیاز در مواجهه با تلاقیِ جذب دادههای عظیم و حقوق مالکیت معنوی را روشن خواهد کرد.
نکات کلیدی
- ابزارهای نظارتی داخلی: اتهامات حاکی از آن است که OpenAI از "Project Giraffe" و فیلتر "Bloom" برای ردیابی فعالانه بازگویی محتوای دارای حق تکثیر استفاده کرده است.
- شهادتهای متناقض: شواهد حاصل از شهادتها نشان میدهد که OpenAI توانایی فنی لازم برای جستجو در دادههای آموزشی خود را داشته است، که با ادعاهای قبلی آن مبنی بر دشواری فنی در تضاد است.
- سلامت فرآیند کشف مدارک در خطر: اکنون سرنوشت این شکایت به این بستگی دارد که آیا OpenAI با حذف خروجیها و ارائه نمونههای دادهایِ دارای حذفیات "غیرقابل استفاده"، دستورات حفظ مدارک را نقض کرده است یا خیر.
