NYT звинувачує OpenAI у приховуванні доказів у важливому судовому процесі щодо авторського права
Триваюча юридична битва між The New York Times та OpenAI набула драматичного повороту: з'явилися звинувачення в тому, що AI-гігант навмисно приховував докази щодо своїх навчальних наборів даних. Ця ескалація загрожує змістити фокус позову з порушення авторських прав на цілісність процесу судового розкриття доказів (discovery process).
Звинувачення в обманних практиках роботи з даними
The New York Times та The Daily News стверджують, що OpenAI надавала неправдиву інформацію щодо своїх технічних можливостей здійснювати пошук як у навчальному корпусі, так і в журналах чатів користувачів. Протягом дворічного судового процесу OpenAI наполягала на тому, що пошук у її величезних наборах даних був би технічно складним і поставив би під загрозу конфіденційність користувачів.
Однак нещодавні свідчення під присягою (deposition) інженера з конфіденційності даних OpenAI Вінні Монако поставили цей наратив під сумнів. Монако нібито розкрив, що OpenAI вже проводила внутрішній пошук у своєму навчальному корпусі саме для виявлення журналістських творів, захищених авторським правом. Крім того, свідчення вказують на те, що OpenAI зібрала базу даних із приблизно 78 мільйонів деідентифікованих розмов ChatGPT для внутрішньої оцінки масштабів потенційного порушення авторських прав.
Project Giraffe та фільтр "Bloom"
Можливо, найбільш значущим технічним відкриттям є "Project Giraffe" — набір інструментів, впроваджених OpenAI. За словами позивачів, невдовзі після подання позову OpenAI використала фільтр "Bloom" у межах цього проєкту для виявлення та фіксації випадків "регургітації" (regurgitation) — коли модель дослівно відтворює захищений авторським правом контент у своїх відповідях.
Існування Project Giraffe суперечить попередній позиції OpenAI про те, що ідентифікація конкретних випадків відтворення контенту в її журналах була нездійсненним завданням. Позивачі стверджують, що ці інструменти доводять: OpenAI не лише була здатна моніторити порушення авторських прав, а й активно створювала інфраструктуру для їх відстеження.
Суперечки щодо цілісності даних та розкриття доказів
Конфлікт також зосереджений на якості даних, наданих суду. Хоча спочатку позивачі запитували вибірку з 120 мільйонів журналів чатів, OpenAI вдалося домовленості знизити цю цифру до 20 мільйонів. Коли вибірка була нарешті подана в грудні, суд, за повідомленнями, визнав її "непридатною для використання" через надмірне редагування (redactions).
NYT пішла ще далі, заявивши, що OpenAI видалила мільярди відповідей ChatGPT в порушення судового наказу про збереження доказів та замінила мільйони журналів у наданій вибірці. У відповідь речник OpenAI Дрю Пусатері заперечив усі звинувачення, звинувативши Times у спробі втрутитися в приватне життя користувачів на тлі послаблення їхньої правової позиції.
Чому це важливо для індустрії ШІ
Ця справа є показником (bellwether) майбутнього розвитку генеративного ШІ та юридичних меж "добросовісного використання" (fair use). Якщо суд встановить, що OpenAI приховувала докази або маніпулювала процесом розкриття, це може створити прецедент щодо того, як компанії ШІ мають розкривати свої методики навчання та походження даних (data lineage). Для розробників і засновників ШІ-стартапів результат прояснить рівень прозорості, необхідний при взаємодії масивного поглинання даних та прав інтелектуальної власності.
Основні висновки
- Інструменти внутрішнього моніторингу: Звинувачення свідчать про те, що OpenAI використовувала "Project Giraffe" та фільтр "Bloom" для активного відстеження повторного відтворення (regurgitation) захищеного авторським правом контенту.
- Протиріччя у свідченнях: Докази зі свідчень під присягою вказують на те, що OpenAI мала технічну можливість здійснювати пошук у своїх навчальних даних, що суперечить її попереднім твердженням про технічну складність.
- Під загрозою цілісність розкриття доказів: Тепер хід судового процесу залежить від того, чи порушила OpenAI накази про збереження доказів, видаляючи відповіді та надаючи "непридатні для використання" відредаговані зразки даних.
