وزارت دادگستری ایالات متحده مداخله حقوقی مهمی در جنگ حق تکثیر (کپی‌رایت) جاری میان غول‌های رسانه‌ای و توسعه‌دهندگان هوش مصنوعی انجام داده است. با استدلال اینکه آموزش مدل‌های زبانی بزرگ (LLMs) بر روی داده‌های دارای حق تکثیر، مصداق «استفاده منصفانه» (fair use) است، وزارت دادگستری سپر قانونی عظیمی برای شرکت‌هایی مانند OpenAI و Microsoft فراهم کرده است.

استدلال وزارت دادگستری: آموزش در مقابل خروجی

در قلب شکایت تجمیعی مربوط به The New York Times، تمایزی بنیادی میان نحوه یادگیری هوش مصنوعی و آنچه تولید می‌کند وجود دارد. The New York Times ادعا می‌کند که میلیون‌ها مقاله آن بدون اجازه برای آموزش مدل‌هایی مانند GPT-4 استفاده شده است که باعث خسارات میلیاردی شده و محصولاتی ایجاد کرده که مستقیماً با این روزنامه رقابت می‌کنند.

با این حال، لایحه اخیر وزارت دادگستری استدلال می‌کند که نقض حق تکثیر در مرحله خروجی رخ می‌دهد، نه در مرحله دریافت داده‌ها (ingestion). این وزارتخانه معتقد است که اگرچه آثار کامل در مرحله آموزش کپی می‌شوند، اما این کپی‌ها هرگز در دسترس عموم قرار نمی‌گیرند. علاوه بر این، وزارت دادگستری تأکید می‌کند که خروجی‌های مدل‌هایی مانند GPT-4 «اغلب، اگر نگوییم همیشه، فاقد شباهت ماهوی» با منبع اصلی هستند. وزارت دادگستری با جداسازی فرآیند آموزش از محتوای تولید شده، تلاش می‌کند تا عمل یادگیری ماشین را از مفهوم حقوقی «جایگزینی در بازار» جدا کند.

«تمثیل همینگوی» و خلاقیت انسانی

برای ملموس کردن مفهوم یادگیری ماشین، وزارت دادگستری از یک تمثیل ادبی با استفاده از نام نویسنده، Joan Didion، بهره برد. در این لایحه اشاره شده است که Didion در دوران نوجوانی، داستان‌های Ernest Hemingway را کپی می‌کرد تا ساختار جملات او را تحلیل کند و مهارت‌های او را بیاموزد. وزارت دادگستری استدلال می‌کند که اگر قانون، آموزش ماشین را به عنوان نقض حق تکثیر تلقی می‌کرد، نویسنده‌ای مانند Didion تئوریکاً می‌توانست هر بار که اثر جدیدی منتشر می‌کند با مسئولیت حقوقی روبرو شود، زیرا فرآیند یادگیری او با نوشته‌های بعدی‌اش پیوندی ناگسستنی دارد.

این وزارتخانه همچنین استدلال می‌کند که اعمال مسئولیت مطلق برای آموزش هوش مصنوعی، به شکلی متناقض، همان خلاقیتی را که قانون کپی‌رایت برای محافظت از آن وضع شده است، سرکوب می‌کند. با توجه به اینکه انسان‌ها به طور فزاینده‌ای از LLMs برای پیش‌نویس و ویرایش آثار اصلی استفاده می‌کنند، وزارت دادگستری پیشنهاد می‌کند که غیرمجاز دانستن آموزش بدون طرح‌های گسترده صدور مجوز، نوآوری‌های مبتنی بر هوش مصنوعی را فلج خواهد کرد.

به چالش کشیدن اداره کپی‌رایت ایالات متحده

موضع وزارت دادگستری مستقیماً با یافته‌های اخیر اداره کپی‌رایت ایالات متحده در تضاد است. Shira Perlmutter، ثبت‌کننده سابق، پیش از این با دفاع کلی از «استفاده منصفانه» مخالفت کرده و خاطرنشان کرده بود که هوش مصنوعی در مقیاس و سرعتی بسیار فراتر از توانایی انسان عمل می‌کند و اغلب محصولات تجاری‌ای تولید می‌کند که مستقیماً با تولیدکنندگان اصلی محتوا رقابت می‌کنند.

وزارت دادگستری در پاسخ به این ارزیابی، حالت تهاجمی به خود گرفته و اعلام کرده است که گزارش Perlmutter فاقد اعتبار حقوقی الزام‌آور است و تحلیل‌های مورد نیاز برای بررسی مورد به مورد (case-by-case) را نادیده گرفته است. این وزارتخانه هشدار می‌دهد که اعمال مسئولیت گسترده، عملاً یک رژیم صدور مجوز را اجباری می‌کند که توسعه مدل‌های پیشرفته هوش مصنوعی را از نظر قانونی و مالی غیرممکن می‌سازد.

نکات کلیدی

  • جداسازی آموزش و خروجی: وزارت دادگستری استدلال می‌کند که کپی کردن متن برای آموزش، اگر خروجی‌های مدل حاصل از آن «شباهت ماهوی» با آثار اصلی نشان ندهند، مصداق نقض حق تکثیر نیست.
  • محافظت از نوآوری: این وزارتخانه هشدار می‌دهد که الزام به دریافت مجوز برای تمام داده‌های آموزشی، خلاقیت را سرکوب کرده و مانع از توسعه LLMهایی می‌شود که به خلق محتوا توسط انسان کمک می‌کنند.
  • یک معیار حقوقی: این مداخله، یک تضاد پرمخاطره میان وزارت دادگستری و اداره کپی‌رایت ایالات متحده ایجاد می‌کند و زمینه را برای یک حکم قطعی دادگاه در مورد آینده هوش مصنوعی مولد فراهم می‌سازد.

ARTICLE: وزارت دادگستری ایالات متحده یک لایحه amicus brief در شکایت کپی‌رایت نیویورک تایمز ارائه کرد و استدلال نمود که کپی کردن متن‌های محافظت‌شده برای آموزش مدل‌های زبانی بزرگ (LLMs) واجد شرایط «استفاده منصفانه» است. این لایحه به شرکت‌هایی مانند OpenAI و Microsoft سپر قانونی می‌دهد که می‌تواند آن‌ها را از پرداخت خساراتی که روزنامه میلیاردی تخمین می‌زند، مصون بدارد.

چرا این پرونده اکنون اهمیت دارد

این شکایت چندین ادعا را تجمیع می‌کند که توسعه‌دهندگان هوش مصنوعی میلیون‌ها مقاله روزنامه را بدون اجازه وارد مدل‌های خود کرده و سپس محصولاتی را عرضه کرده‌اند که مستقیماً با گزارش‌های خودِ تایمز رقابت می‌کنند. اگر دادگاه استدلال «استفاده منصفانه» وزارت دادگستری را رد کند، شرکت‌های هوش مصنوعی ممکن است با هزینه‌های سنگین مجوز مواجه شوند یا مجبور به توقف توسعه نسل بعدی عوامل گفتگوگر (conversational agents) شوند.

استدلال اصلی وزارت دادگستری

این لایحه گردش کار هوش مصنوعی را به دو مرحله متمایز تقسیم می‌کند. نخست، مدل مجموعه‌های بزرگی از متن را جذب می‌کند؛ دوم، به پرسش‌های کاربران پاسخ می‌دهد. این وزارتخانه می‌گوید نقض حقوق تنها زمانی رخ می‌دهد که یک اثر دارای حق چاپ (کپی‌رایت) به گونه‌ای بازتولید شود که عموم مردم بتوانند به آن دسترسی داشته باشند. از آنجایی که نسخه‌های آموزشی هرگز از سرورهای توسعه‌دهنده خارج نمی‌شوند، عمل جذب داده‌ها به آن آستانه نمی‌رسد.

وزارت دادگستری (DOJ) همچنین بر آزمون «شباهت ماهوی»، که یک استاندارد دیرینه در کپی‌رایت است، تکیه می‌کند. این وزارتخانه استدلال می‌کند که متن خروجی مدل‌هایی مانند GPT-4 «اغلب، اگر نگوییم همیشه»، آن‌قدر با هر منبع واحد تفاوت دارد که خواهان نمی‌تواند شباهت لازم را اثبات کند. به طور خلاصه، این لایحه استدلال می‌کند که تمرکز حقوقی باید بر خروجی نهایی باشد، نه بر فرآیند یادگیری داخلی.

یک تمثیل ادبی برای روشن شدن موضوع

برای ملموس‌تر کردن استدلال فنی، این لایحه به داستانی درباره یک نویسنده نوجوان اشاره می‌کند که داستان‌های ارنست همینگوی را برای مطالعه سبک او کپی می‌کرد. وزارت دادگستری می‌گوید اگر قانون با آن تمرین یادگیری به عنوان نقض کپی‌رایت برخورد می‌کرد، نویسنده می‌توانست هر بار که اثر جدیدی منتشر می‌کند مورد شکایت قرار گیرد، حتی اگر کار او اصیل بود. این وزارتخانه هشدار می‌دهد که تعمیم همین منطق به هوش مصنوعی، «همان خلاقیتی را که قانون کپی‌رایت برای محافظت از آن طراحی شده است، فلج خواهد کرد.»

مخاطرات برای توسعه‌دهندگان هوش مصنوعی و تولیدکنندگان محتوا

  • ریسک نوآوری: الزام به دریافت مجوز برای هر قطعه متن مورد استفاده در آموزش می‌تواند هزینه‌ها را چنان بالا ببرد که ساخت مدل‌های پیشرفته از نظر مالی غیرممکن شود.
  • گردش کار خلاقانه: نویسندگان انسانی به طور فزاینده‌ای برای پیش‌نویس، ویرایش و ایده‌پردازی به LLMها متکی هستند. اگر فرآیند آموزش غیرقانونی تشخیص داده شود، این ابزارها ممکن است ناپدید شوند و شیوه تولید محتوا را در صنایع مختلف تغییر دهند.
  • تأثیر بر بازار: صنعت روزنامه‌نگاری استدلال می‌کند مدل‌های هوش مصنوعی که می‌توانند به سؤالات پاسخ دهند یا متنی شبیه به اخبار تولید کنند، ارزش گزارش‌گری اصیل را کاهش می‌دهند و پتانسیل جذب درآمد تبلیغات و حق اشتراک را از آن‌ها می‌گیرند.

دیدگاه متقابل اداره کپی‌رایت

گزارش اخیر اداره کپی‌رایت ایالات متحده، که تحت نظارت مدیر سابق، شیرا پرلموتر، تهیه شده است، با دفاع کلی از «استفاده منصفانه» (fair-use) مخالفت کرد. این اداره بر سه عامل تأکید کرد که هوش مصنوعی را از یادگیری انسانی متمایز می‌کند: حجم عظیم مطالب کپی‌شده، سرعتی که با آن پردازش می‌شوند، و این واقعیت که مدل‌های حاصل می‌توانند به عنوان محصولات تجاری بسته‌بندی و فروخته شوند که مستقیماً با خالقان منابع اصلی رقابت می‌کنند.

وزارت دادگستری این نکات را رد می‌کند و خاطرنشان می‌سازد که این گزارش فاقد اعتبار قانونی الزام‌آور است و رویه‌های قضایی موجود در حال حاضر مستلزم تحلیل مورد به موردِ استفاده منصفانه هستند. این وزارتخانه هشدار می‌دهد که اعمال «مسئولیت گسترده» عملاً صنعت را مجبور به پذیرش رژیم مجوزدهی می‌کند که «توسعه مدل‌های پیشرفته هوش مصنوعی را از نظر قانونی و مالی غیرممکن می‌سازد.»

آنچه ممکن است در آینده رخ دهد

دادگاه منطقه‌ای که پرونده تایمز را رسیدگی می‌کند، باید موضع وزارت دادگستری در مورد استفاده منصفانه را در برابر یافته‌های اداره کپی‌رایت بسنجد. حکمی به نفع وزارت دادگستری، سابقه‌ای ایجاد می‌کند که نشان می‌دهد داده‌های آموزشی را می‌توان بدون اجازه صریح جمع‌آوری کرد، مشروط بر اینکه خروجی‌های مدل از شباهت ماهوی فاصله داشته باشند. تصمیمی به نفع روزنامه‌ها می‌تواند موجی از مذاکرات مربوط به مجوزدهی را به راه بیندازد و به طور بالقوه اقتصاد تحقیقات هوش مصنوعی را بازتعریف کند.

خلاصه کلام

لایحه وزارت دادگستری، پرسشِ اینکه آیا آموزش هوش مصنوعی مصداق «استفاده منصفانه» است یا خیر را به یک نبرد حقوقی پرمخاطره تبدیل می‌کند. نتیجه مشخص خواهد کرد که آیا توسعه‌دهندگان می‌توانند به ساخت مدل‌های زبانی قدرتمند بر پایه متون موجود ادامه دهند یا باید برای هر قطعه از مطالبی که جذب می‌کنند، به دنبال مجوزهای پرهزینه باشند. این تصمیم در بخش فناوری، صنعت رسانه و اقتصاد خلاق گسترده‌تر، بازتاب‌های وسیعی خواهد داشت.