NYT обвиняет OpenAI в сокрытии улик в крупном процессе по авторскому праву
Продолжающееся судебное разбирательство между The New York Times и OpenAI приняло драматический оборот: появились обвинения в том, что ИИ-гигант намеренно скрывал доказательства, касающиеся его обучающих наборов данных. Эта эскалация грозит сместить фокус иска с нарушения авторских прав на честность процесса судебного раскрытия доказательств (discovery).
Обвинения в обманных методах работы с данными
The New York Times и The Daily News утверждают, что OpenAI вводила в заблуждение относительно своих технических возможностей по поиску как в обучающем корпусе, так и в логах чатов пользователей. На протяжении двух лет судебного процесса OpenAI настаивала на том, что поиск по ее массивным наборам данных был бы технически обременительным и нарушил бы конфиденциальность пользователей.
Однако недавние показания под присягой инженера по конфиденциальности данных OpenAI Винни Монако поставили этот нарратив под сомнение. Монако якобы сообщил, что OpenAI уже проводила внутренний поиск по своему обучающему корпусу специально для выявления журналистских работ, защищенных авторским правом. Кроме того, показания указывают на то, что OpenAI собрала базу данных из примерно 78 миллионов деидентифицированных диалогов ChatGPT для внутренней оценки масштабов потенциального нарушения авторских прав.
Project Giraffe и фильтр «Bloom»
Пожалуй, самым значимым техническим откровением стал «Project Giraffe» — набор инструментов, внедренных OpenAI. По словам истцов, вскоре после подачи иска OpenAI использовала фильтр «Bloom» в рамках этого проекта для обнаружения и фиксации случаев «регургитации» (regurgitation) — когда модель воспроизводит защищенный авторским правом контент дословно в своих ответах.
Существование Project Giraffe противоречит прежней позиции OpenAI о том, что выявление конкретных случаев воспроизведения контента в ее логах было невыполнимой задачей. Истцы утверждают, что эти инструменты доказывают: OpenAI не только была способна отслеживать нарушения авторских прав, но и активно создавала инфраструктуру для этого.
Споры о целостности данных и раскрытии доказательств
Конфликт также сосредоточен вокруг качества данных, предоставленных суду. Хотя изначально истцы запрашивали выборку из 120 миллионов логов чатов, OpenAI удалось снизить это число до 20 миллионов. Когда выборка была наконец представлена в декабре, суд, по сообщениям, признал ее «непригодной» из-за чрезмерного количества скрытий (redactions).
NYT пошла еще дальше, утверждая, что OpenAI удалила миллиарды ответов ChatGPT в нарушение судебного приказа о сохранении данных и подменила миллионы логов в предоставленной выборке. В ответ представитель OpenAI Дрю Пусатери отверг все обвинения, обвинив Times в попытке вторгнуться в частную жизнь пользователей на фоне ослабления их правовой позиции.
Почему это важно для индустрии ИИ
Это дело является индикатором будущего развития генеративного ИИ и юридических границ «добросовестного использования» (fair use). Если суд установит, что OpenAI скрывала доказательства или манипулировала процессом раскрытия данных, это может создать прецедент того, как компании в сфере ИИ должны раскрывать свои методологии обучения и происхождение данных (data lineage). Для разработчиков и основателей ИИ-стартапов исход дела прояснит уровень прозрачности, необходимый при работе на стыке массового сбора данных и прав интеллектуальной собственности.
Основные выводы
- Инструменты внутреннего мониторинга: Согласно обвинениям, OpenAI использовала «Project Giraffe» и фильтр «Bloom» для активного отслеживания случаев воспроизведения защищенного авторским правом контента.
- Противоречивые показания: Доказательства из показаний под присягой указывают на то, что OpenAI обладала технической возможностью осуществлять поиск по своим обучающим данным, что противоречит ее предыдущим заявлениям о технической сложности этой задачи.
- Целостность процесса раскрытия под угрозой: Теперь исход судебного процесса зависит от того, нарушила ли OpenAI приказы о сохранении данных, удаляя ответы модели и предоставляя «непригодные» образцы данных с чрезмерными правками.
