هوش مصنوعی Gemini گوگل با یک شکایت دسته جمعی در دادگاه فدرال نیویورک مواجه شده است که این شرکت را متهم می‌کند مدل‌های خود را بدون اجازه، بر روی کتاب‌ها و مقالات دارای کپی‌رایت آموزش داده است. در این شکایت که توسط ائتلافی شامل ناشران بزرگ و نویسنده، Scott Turow، ارائه شده، آمده است که گوگل به عمد اطلاعات کپی‌رایت را حذف کرده تا استفاده از «مطالب سرقتی» در سیستم هوش مصنوعی مولد خود را پنهان کند.

شکایت و ادعاهای اصلی آن

در پرونده ارائه‌شده به دادگاه منطقه‌ای ایالات متحده در منطقه جنوبی نیویورک، Hachette، Cencage، Elsevier، مجموعه S.C.R.I.B.E. و Turow به عنوان خواهان‌ها فهرست شده‌اند. آن‌ها ادعا می‌کنند که گوگل از توافق «فقط بخش‌های کوتاه» (snippet-only) که بر Google Books حاکم بود فراتر رفته و از آثار متن کامل موجود در آن آرشیو و همچنین از عناوین بارگذاری‌شده در Google Play برای آموزش Gemini استفاده کرده است. طبق این شکایت، گوگل نه تنها محتوا را استخراج (scrape) کرده، بلکه متادیتای کپی‌رایت را نیز تغییر داده یا حذف کرده است؛ اقدامی که به گفته خواهان‌ها با هدف پنهان کردن نقض حق چاپ انجام شده است.

یک یادداشت داخلی گوگل که در این شکایت به آن اشاره شده، هشدار می‌دهد که استفاده از کتاب‌های دارای کپی‌رایت برای آموزش هوش مصنوعی می‌تواند «بسیار مشکل‌ساز» باشد و شرکت را در معرض جریمه‌هایی بین ۱۰ تا ۱۰۰ میلیارد دلار قرار دهد. خواهان‌ها به جریمه اخیر ۱.۵ میلیارد دلاری علیه یک شرکت هوش مصنوعی دیگر به دلیل استفاده غیرمجاز از داده‌ها، به عنوان معیاری برای سنجش میزان مسئولیت‌های احتمالی اشاره می‌کنند.

چگونه به اینجا رسیدیم

رابطه گوگل با ناشران کتاب با Google Books آغاز شد؛ یک فهرست قابل جستجو که بخش‌های کوتاهی از متن و جزئیات کتاب‌شناختی را نمایش می‌داد، در حالی که متن کامل را پشت یک دیوار پرداخت (paywall) نگه می‌داشت. آن مدل بر توافق‌نامه‌های مجوز متکی بود که گوگل را به نمایش بخش‌های کوتاه (snippets) محدود می‌کرد. در طول سال‌ها، گوگل دارایی‌های خود را از طریق فروشگاه Google Play گسترش داد، جایی که ناشران و نویسندگان کتاب‌های الکترونیکی با متن کامل را برای فروش بارگذاری می‌کنند.

خواهان‌ها استدلال می‌کنند که تغییر رویکرد گوگل از یک سرویس نمایه‌سازی با «محدوده محدود» به یک منبع داده برای آموزش مدل‌های زبانی بزرگ (LLMs)، نقض توافق‌نامه‌های اصلی است. آن‌ها می‌گویند این شرکت هرگز مجوزهای گسترده مورد نیاز برای وارد کردن آثار کامل به خط لوله آموزشی Gemini را دریافت نکرده است.

آنچه برای گوگل و صنعت هوش مصنوعی در خطر است

اگر دادگاه تشخیص دهد که استفاده از مطالب دارای کپی‌رایت بدون مجوز، قوانین حق چاپ را نقض می‌کند، این تصمیم می‌تواند نحوه جمع‌آوری داده‌های آموزشی توسط توسعه‌دهندگان هوش مصنوعی را بازتعریف کند.

دفاعیات و استدلال‌های احتمالی

گوگل احتمالاً بر دکترین «استفاده منصفانه» (fair use) تکیه خواهد کرد که اجازه استفاده محدود از مطالب دارای کپی‌رایت را برای تفسیر، نقد یا تغییر شکل (transformation) می‌دهد. احکام اخیر در کالیفرنیا، آموزش هوش مصنوعی را یک فعالیت تحول‌آفرین تلقی کرده و به آن حفاظت تحت قانون استفاده منصفانه را اعطا کرده‌اند. خواهان‌های نیویورک برای اجتناب از این سوابق قضایی، پرونده خود را خارج از آن حوزه قضایی ثبت کردند.

خواهان‌ها در پاسخ می‌گویند که حذف متادیتای کپی‌رایت نشان‌دهنده قصد پنهان کردن منبع است که هرگونه ادعای تغییر شکل با حسن نیت را بی‌اعتبار می‌کند. آن‌ها همچنین به آن یادداشت داخلی به عنوان مدرکی بر این موضوع استناد می‌کنند که گوگل ریسک قانونی را تشخیص داده بود.

آنچه باید در ادامه دنبال کرد

این پرونده از مراحل درخواست‌های پیش از محاکمه عبور خواهد کرد که می‌تواند استدلال‌های طرفین را شکل دهد، از جمله اینکه آیا دادگاه تحلیل «استفاده منصفانه» مورد استفاده در کالیفرنیا را اعمال خواهد کرد یا استاندارد متفاوتی را اتخاذ می‌کند. حکم مربوط به صلاحیت قضایی می‌تواند تعیین کند که آیا دادگاه‌های نیویورک به محل اصلی رسیدگی به اختلافات کپی‌رایت مرتبط با هوش مصنوعی تبدیل خواهند شد یا خیر.

خلاصه کلام: شکایت نیویورک علیه Gemini گوگل می‌تواند مرز بین استفاده مجاز از داده‌ها و نقض کپی‌رایت را بازتعریف کند، توسعه‌دهندگان هوش مصنوعی را مجبور کند در نحوه تهیه مواد اولیه مورد نیاز برای مدل‌های خود تجدیدنظر کنند و اقتصاد کل این صنعت را تغییر دهد.