Творча спільнота більше не спостерігає пасивно за тим, як праця всього її життя поглинається масивними навчальними наборами даних. Від визнаних авторів до цифрових ілюстраторів — зростаюча хвиля судових позовів кидає виклик доктрині «добросовісного використання» (fair use), яку використовують ШІ-гіганти для виправдання несанкціонованого збору інтелектуальної власності.

Виявлення несанкціонованих навчальних наборів даних

Напруженість між творцями та розробниками ШІ досягла точки кипіння після звітів The Atlantic, яке опублікувало доступний для пошуку набір даних із детальним описом робіт, використаних для навчання великих мовних моделей. Для таких авторів, як Кірк Уоллес Джонсон, це відкриття стало особистим і глибоким. Джонсон, відомий своїми ґрунтовними документальними працями, такими як The Feather Thief та The Fishermen and the Dragon, виявив, що роки кропітких досліджень і письма були піратовані та використані в чат-ботах без згоди чи компенсації.

Це явище не є поодиноким випадком, а системною практикою. Творчі професіонали виявляють, що їхні власні роботи — часто результат років праці — використовуються для збагачення «галактично багатих» корпорацій. Це усвідомлення змістило настрої від простого занепокоєння до активних судових процесів, оскільки митці прагнуть повернути контроль над своєю інтелектуальною власністю.

Стратегічні судові позови: удар по технологічних гігантів

Юридичний наступ є багатогранним і спрямований на основні механізми створення моделей генеративного ШІ. Митці не просто покладаються на позови про порушення авторських прав; вони також вивчають такі шляхи, як порушення умов надання послуг, щоб притягнути компанії до відповідальності.

Гучні юридичні битви вже тривають. Багато творців об'єднали зусилля зі спеціалізованими юридичними командами, такими як Susman Godfrey, яка наразі очолює значну справу проти Anthropic від імені різних авторів. Іншими піонерами цього руху є ілюстраторка та карикатуристка Сара Андерсен, яка була однією з перших, хто безпосередньо кинув виклик ШІ-гігантам. Ці позови мають на меті зруйнувати залежність індустрії від безкоштовного скрейпінгу даних і встановити новий стандарт формування навчальних наборів.

Поле битви за «добросовісне використання»

Центральна напруженість у цих залах суду полягає в юридичному визначенні «добросовісного використання». Компанії ШІ стверджують, що навчання моделі на існуючих даних є трансформаційним процесом і підпадає під юридичний захист. Однак творці стверджують, що коли ШІ може відтворити специфічний стиль митця або унікальний голос автора, це перестає бути трансформаційним і стає прямим ринковим замінником, який знецінює оригінальну роботу.

У міру розвитку цих справ вони визначатимуть майбутнє ландшафту ШІ. Результати вирішать, чи є поточна траєкторія «ШІ-сміття» (AI slop) — масового виробництва низькоякісного, похідного контенту — юридично стійкою, чи має настати нова ера ліцензованого, етичного отримання даних для захисту творців-людей, які стоять у центрі інформаційної економіки.

Основні висновки

  • Системний скрейпінг даних: Було виявлено, що основні моделі ШІ використовують піратовані набори даних, що містять ґрунтовні книги та авторські художні роботи без згоди творців.
  • Диверсифіковані юридичні стратегії: Позови спрямовані проти компаній ШІ через порушення авторських прав, порушення умов надання послуг та оскарження доктрини «добросовісного використання».
  • Поворотний момент для інтелектуальної власності: Результати поточних справ проти таких компаній, як Anthropic, створять юридичний прецедент того, як інтелектуальна власність оцінюватиметься в епоху генеративного ШІ.

Як спалахнула суперечка

Іскра спалахнула, коли відомий журнал опублікував список книг, статей та художніх творів, на яких навчалися великі мовні моделі, доступний для пошуку. Для автора Кірка Уоллеса Джонсона, чиї документальні книги вимагали років досліджень і подорожей, це відкриття стало особистим. Він виявив, що самі слова, які він вдосконалював протягом десятиліття, були частиною даних, що живлять чат-боти, здатні відтворювати його стиль за запитом, без будь-яких роялті чи згадки про авторство.

Досвід Джонсона не є поодиноким випадком. Творці в галузях літератури, ілюстрації, музики та кіно повідомляють, що їхні об'єкти авторського права збираються масово. Ця практика, яку інсайдери галузі описують як систематичне вилучення «піратованих наборів даних», перетворила занепокоєння на скоордовані юридичні дії. Митці тепер стверджують, що цінність, яку вони створюють, перетікає до «галактично багатих» технологічних конгломератів, які отримують прибуток від їхньої праці, тоді як самі творці не отримують нічого.

The lawsuits that are shaping the fight

The legal offensive is aimed at the core of how generative AI models are assembled. Plaintiffs are filing claims not only for copyright infringement but also for breaches of the platforms’ own terms of service. Illustrator and cartoonist Sarah Andersen, whose work has become a staple of internet culture, was among the first visual artists to bring a direct lawsuit against an AI company. Her filing contends that the model’s ability to mimic her distinctive line work and humor erodes the market for her original comics, effectively turning her brand into a free-for-all resource.

These cases are being handled by lawyers who specialize in intellectual-property disputes and who have a track record of challenging tech giants. Their strategy is to force discovery of the exact datasets used, compel companies to halt the use of disputed material, and seek damages that reflect the commercial value of the stolen content.

The “fair use” argument under fire

AI developers maintain that training a model on publicly available data is a transformative use that the law protects. They argue that the model does not reproduce any single work verbatim; instead, it learns patterns that enable it to generate new text or images. From that perspective, the process is akin to a researcher reading many books to gain insight, rather than copying them.

Creators counter that transformation is a thin excuse when the output can be a near-duplicate of an author’s voice or an artist’s style. When a chatbot can answer a question with the same cadence and phrasing that a novelist is known for, or when an image-generator can produce pictures that are indistinguishable from a living illustrator’s portfolio, the result functions as a market substitute. The plaintiffs argue that this substitution harms their ability to sell books, commissions and licensing deals, and that the “fair use” defense collapses under the weight of commercial impact.

What’s at stake

  • Economic pressure on AI firms – If courts rule that large-scale scraping violates copyright, companies could face significant financial consequences, potentially prompting changes to data pipelines.

  • Court filings and discovery – The next wave of documents will reveal exactly which titles and images were used, giving a clearer picture of the scale of data harvesting.