نیویورک تایمز OpenAI را به پنهان کردن شواهد در دادگاه بزرگ حق تکثیر متهم کرد

نبرد حقوقی جاری میان The New York Times و OpenAI تحول دراماتیکی یافته است؛ با این اتهام که این غول هوش مصنوعی عامدانه شواهد مربوط به مجموعه‌داده‌های آموزشی خود را پنهان کرده است. این تشدید تنش تهدید می‌کند که تمرکز این شکایت از نقض حق تکثیر (کپی‌رایت) به سلامت فرآیند کشف مدارک قضایی تغییر یابد.

اتهامات مربوط به شیوه‌های فریبکارانه داده‌ای

The New York Times و The Daily News ادعا می‌کنند که OpenAI در مورد توانایی فنی خود برای جستجو در پیکره آموزشی و همچنین گزارش‌های چت مشتریان، عدم صداقت به خرج داده است. در طول این دادگاه دو ساله، OpenAI همواره مدعی بوده که جستجو در مجموعه‌داده‌های عظیم خود از نظر فنی دشوار است و حریم خصوصی کاربران را به خطر می‌اندازد.

با این حال، شهادت اخیر وینی موناکو (Vinnie Monaco)، مهندس حریم خصوصی داده‌ها در OpenAI، این روایت را به چالش کشیده است. گفته می‌شود موناکو فاش کرده که OpenAI پیش از این جستجوهای داخلی در پیکره آموزشی خود را به‌طور مشخص برای شناسایی آثار روزنامه‌نگاری دارای حق تکثیر انجام داده است. علاوه بر این، این شهادت نشان می‌دهد که OpenAI پایگاه داده‌ای شامل تقریباً ۷۸ میلیون گفتگوی بدون هویت ChatGPT را برای ارزیابی داخلی میزان نقض احتمالی حق تکثیر جمع‌آوری کرده است.

پروژه Giraffe و فیلتر "Bloom"

شاید مهم‌ترین افشاگری فنی مربوط به "Project Giraffe" باشد، مجموعه‌ای از ابزارها که توسط OpenAI پیاده‌سازی شده است. طبق گفته شاکیان، مدت کوتاهی پس از ثبت شکایت، OpenAI از یک فیلتر "Bloom" به عنوان بخشی از این پروژه برای شناسایی و ثبت موارد "بازگویی" (regurgitation) استفاده کرد؛ یعنی زمانی که مدل، محتوای دارای حق تکثیر را عیناً در خروجی‌های خود بازتولید می‌کند.

وجود Project Giraffe با موضع قبلی OpenAI مبنی بر اینکه شناسایی موارد خاص بازتولید محتوا در گزارش‌های خود یک کار غیرممکن است، در تضاد است. شاکیان استدلال می‌کنند که این ابزارها ثابت می‌کنند OpenAI نه تنها قادر به نظارت بر نقض حق تکثیر بوده، بلکه فعالانه در حال ساخت زیرساخت‌هایی برای ردیابی آن بوده است.

اختلافات بر سر سلامت داده‌ها و کشف مدارک

این درگیری همچنین بر کیفیت داده‌های ارائه‌شده به دادگاه متمرکز شده است. در حالی که شاکیان در ابتدا درخواست نمونه‌ای شامل ۱۲۰ میلیون گزارش چت را داشتند، OpenAI این رقم را به ۲۰ میلیون کاهش داد. گزارش شده است زمانی که این نمونه در ماه دسامبر ارائه شد، دادگاه آن را به دلیل حذفیات (redactions) بیش از حد، "غیرقابل استفاده" تشخیص داد.

نیویورک تایمز فراتر رفته و ادعا کرده است که OpenAI میلیاردها خروجی ChatGPT را برخلاف دستور دادگاه برای حفظ مدارک، حذف کرده و میلیون‌ها گزارش را در نمونه ارائه‌شده جایگزین کرده است. در پاسخ، درو پوساتری (Drew Pusateri)، سخنگوی OpenAI، تمامی اتهامات را رد کرده و تایمز را متهم کرده است که با تضعیف پرونده حقوقی خود، سعی در نقض حریم خصوصی کاربران دارد.

چرا این موضوع برای صنعت هوش مصنوعی اهمیت دارد

این پرونده شاخصی برای آینده توسعه هوش مصنوعی مولد و مرزهای قانونی "استفاده منصفانه" (fair use) است. اگر دادگاه تشخیص دهد که OpenAI مدارک را پنهان کرده یا در فرآیند کشف مدارک دستکاری انجام داده است، می‌تواند الگویی برای نحوه افشای روش‌های آموزشی و منشأ داده‌ها توسط شرکت‌های هوش مصنوعی ایجاد کند. برای توسعه‌دهندگان و بنیان‌گذاران هوش مصنوعی، نتیجه این پرونده سطح شفافیت مورد نیاز در مواجهه با تلاقیِ جذب داده‌های عظیم و حقوق مالکیت معنوی را روشن خواهد کرد.

نکات کلیدی

  • ابزارهای نظارتی داخلی: اتهامات حاکی از آن است که OpenAI از "Project Giraffe" و فیلتر "Bloom" برای ردیابی فعالانه بازگویی محتوای دارای حق تکثیر استفاده کرده است.
  • شهادت‌های متناقض: شواهد حاصل از شهادت‌ها نشان می‌دهد که OpenAI توانایی فنی لازم برای جستجو در داده‌های آموزشی خود را داشته است، که با ادعاهای قبلی آن مبنی بر دشواری فنی در تضاد است.
  • سلامت فرآیند کشف مدارک در خطر: اکنون سرنوشت این شکایت به این بستگی دارد که آیا OpenAI با حذف خروجی‌ها و ارائه نمونه‌های داده‌ایِ دارای حذفیات "غیرقابل استفاده"، دستورات حفظ مدارک را نقض کرده است یا خیر.