Штучний інтелект Gemini від Google зіткнувся з колективним позовом, поданим до федерального суду Нью-Йорка, у якому компанію звинувачують у навчанні своїх моделей на книгах та статтях, що захищені авторським правом, без дозволу. У скарзі, поданій коаліцією, до якої входять великі видавництва та письменник Скотт Тьюро (Scott Turow), стверджується, що Google навмисно видаляла інформацію про авторське право, щоб приховати використання «крадених матеріалів» у своїй системі генеративного ШІ.
Позов та його основні претензії
У позовній заяві до Окружного суду США по Південному округу Нью-Йорка позивачами вказані Hachette, Cencage, Elsevier, колектив S.C.R.I.B.E. та Тьюро. Вони стверджують, що Google вийшла за межі домовленості про «лише фрагменти» (snippet-only), яка регулювала Google Books, використовуючи повнотекстові роботи з цього архіву та з назв, завантажених у Google Play, для навчання Gemini. Згідно зі скаргою, Google не лише збирала контент, а й змінювала або видаляла метадані про авторське право — крок, який, за словами позивачів, мав на меті приховати порушення.
У внутрішній службовій записці Google, на яку посилається позов, міститься попередження, що використання книг, захищених авторським правом, для навчання ШІ може бути «надзвичайно проблематичним» і призвести до штрафів для компанії в розмірі від 10 до 100 мільярдів доларів. Позивачі вказують на нещодавній штраф у розмірі 1,5 мільярда доларів проти іншої ШІ-компанії за несанкціоноване використання даних як на орієнтир масштабу потенційної відповідальності.
Як ми до цього дійшли
Відносини Google з книжковими видавництвами почалися з Google Books — пошукового індексу, який відображав короткі уривки та бібліографічні дані, залишаючи повний текст за платним доступом. Ця модель базувалася на ліцензійних угодах, які обмежували Google лише відображенням фрагментів. Протягом років Google розширювала свої можливості через магазин Google Play, куди видавці та автори завантажують повнотекстові електронні книги для продажу.
Позивачі стверджують, що перехід Google від індексаційного сервісу з «обмеженою сферою застосування» до джерела даних для навчання великих мовних моделей (LLM) порушує первинні угоди. Вони зазначають, що компанія ніколи не отримувала широких дозволів, необхідних для включення цілих творів у процес навчання Gemini.
Що стоїть на кону для Google та індустрії ШІ
Якщо суд визнає, що використання матеріалів, захищених авторським правом, без ліцензії порушує закон про авторське право, це рішення може змінити те, як розробники ШІ збирають навчальні дані.
Можливі методи захисту та контраргументи
Google, ймовірно, спиратиметься на доктрину «добросовісного використання» (fair use), яка дозволяє обмежене використання об'єктів авторського права для коментарів, критики або трансформації. Нещодавні судові рішення в Каліфорнії розглядали навчання ШІ як трансформаційну діяльність, надаючи їй захист у межах добросовісного використання. Позивачі з Нью-Йорка подали позов поза межами цієї юрисдикції, щоб уникнути цих прецедентів.
Позивачі натомість стверджують, що видалення метаданих про авторське право свідчить про намір приховати джерело, що підриває будь-які заяви про добросовісну трансформацію. Вони також наводять внутрішню службову записку як доказ того, що Google усвідомлювала юридичний ризик.
За чим стежити далі
Справа пройде через стадію досудових клопотань, які можуть визначити аргументи обох сторін, зокрема те, чи застосує суд аналіз «добросовісного використання», як це було в Каліфорнії, чи прийме інший стандарт. Рішення щодо юрисдикції може визначити, чи стануть суди Нью-Йорка основним місцем розгляду спорів про авторське право, пов'язаних із ШІ.
Підсумок: Позов у Нью-Йорку проти Gemini від Google може переглянути межу між дозволеним використанням даних і порушенням авторських прав, змусивши розробників ШІ переосмислити способи отримання сировини, яка живить їхні моделі, та змінити економіку всієї галузі.
