Cộng đồng sáng tạo không còn đứng nhìn một cách thụ động khi thành quả cả đời của họ bị đưa vào các tập dữ liệu huấn luyện khổng lồ. Từ những tác giả lừng danh đến các họa sĩ minh họa kỹ thuật số, một làn sóng hành động pháp lý đang ngày càng lớn mạnh nhằm thách thức lập luận về "sử dụng hợp lý" (fair use) mà các gã khổng lồ AI đang sử dụng để biện minh cho việc thu thập trái phép sở hữu trí tuệ.

Sự phát hiện về các tập dữ liệu huấn luyện trái phép

Sự căng thẳng giữa những người sáng tạo và các nhà phát triển AI đã lên đến đỉnh điểm sau các báo cáo từ tờ The Atlantic, nơi đã công bố một tập dữ liệu có thể tìm kiếm được, chi tiết hóa các tác phẩm được sử dụng để huấn luyện các mô hình ngôn ngữ lớn. Đối với những tác giả như Kirk Wallace Johnson, khám phá này mang tính cá nhân và sâu sắc. Johnson, người nổi tiếng với các tác phẩm phi hư cấu được nghiên cứu kỹ lưỡng như The Feather ThiefThe Fishermen and the Dragon, đã phát hiện ra rằng nhiều năm nghiên cứu và viết lách đầy tâm huyết của mình đã bị vi phạm bản quyền và đưa vào các chatbot mà không có sự đồng ý hay bồi thường nào.

Hiện tượng này không phải là một sự cố đơn lẻ mà là một thực trạng mang tính hệ thống. Các chuyên gia sáng tạo đang phát hiện ra rằng các tác phẩm độc quyền của họ—thường là kết quả của nhiều năm lao động—đang được sử dụng để xây dựng nên các tập đoàn "giàu nứt đố đổ vách". Nhận thức này đã chuyển dịch tâm lý từ lo ngại đơn thuần sang các vụ kiện tụng tích cực, khi các nghệ sĩ tìm cách giành lại quyền kiểm soát sở hữu trí tuệ của mình.

Kiện tụng chiến lược: Nhắm vào các gã khổng lồ công nghệ

Cuộc tấn công pháp lý này mang tính đa diện, nhắm vào các cơ chế cốt lõi về cách thức xây dựng các mô hình AI tạo sinh. Các nghệ sĩ không chỉ dựa vào các cáo buộc vi phạm bản quyền; họ còn đang khám phá các con đường khác như vi phạm điều khoản dịch vụ để buộc các công ty phải chịu trách nhiệm.

Các cuộc chiến pháp lý quy mô lớn đã bắt đầu. Nhiều nhà sáng tạo đã hợp lực với các đội ngũ pháp lý chuyên biệt, chẳng hạn như Susman Godfrey, đơn vị hiện đang dẫn đầu một vụ kiện quan trọng chống lại Anthropic thay mặt cho nhiều tác giả khác nhau. Những người tiên phong khác trong phong trào này bao gồm họa sĩ minh họa và họa sĩ truyện tranh Sarah Andersen, một trong những người đầu tiên trực tiếp thách thức các gã khổng lồ AI. Những vụ kiện này nhằm phá bỏ sự phụ thuộc của ngành công nghiệp vào việc thu thập dữ liệu không bồi thường và buộc phải thiết lập một tiêu chuẩn mới cho cách thức tuyển chọn các tập dữ liệu huấn luyện.

Chiến trường "Sử dụng hợp lý"

Sự căng thẳng trung tâm tại các phòng xử án nằm ở định nghĩa pháp lý về "sử dụng hợp lý" (fair use). Các công ty AI lập luận rằng việc huấn luyện một mô hình trên dữ liệu hiện có mang tính chuyển đổi và nằm trong phạm vi được pháp luật bảo vệ. Tuy nhiên, những người sáng tạo lập luận rằng khi một AI có thể sao chép phong cách cụ thể của một nghệ sĩ hoặc giọng văn độc đáo của một tác giả, nó không còn mang tính chuyển đổi nữa mà trở thành một sự thay thế thị trường trực tiếp, làm mất giá trị của tác phẩm gốc.

Khi các vụ kiện này tiến triển, chúng sẽ định hình tương lai của bối cảnh AI. Kết quả sẽ quyết định liệu quỹ đạo hiện tại của "AI slop"—việc sản xuất hàng loạt các nội dung kém chất lượng, mang tính phái sinh—có thể duy trì về mặt pháp lý hay không, hoặc liệu một kỷ nguyên mới của việc thu thập dữ liệu có bản quyền và đạo đức có phải trỗi dậy để bảo vệ những người sáng tạo con người vốn là trọng tâm của nền kinh tế thông tin.

Các điểm chính cần lưu ý

  • Thu thập dữ liệu có hệ thống: Các mô hình AI lớn đã bị phát hiện sử dụng các tập dữ liệu vi phạm bản quyền chứa các sách nghiên cứu sâu và các tác phẩm nghệ thuật độc quyền mà không có sự đồng ý của người sáng tạo.
  • Chiến lược pháp lý đa dạng: Các vụ kiện đang nhắm vào các công ty AI thông qua vi phạm bản quyền, vi phạm điều khoản dịch vụ và thách thức học thuyết "sử dụng hợp lý".
  • Thời điểm then chốt cho IP: Kết quả của các vụ kiện đang diễn ra chống lại các công ty như Anthropic sẽ thiết lập tiền lệ pháp lý cho cách thức định giá sở hữu trí tuệ trong thời đại AI tạo sinh.

Sự tranh cãi đã bùng nổ như thế nào

Ngòi nổ xuất hiện khi một tạp chí lớn công bố danh sách có thể tìm kiếm được về các cuốn sách, bài báo và tác phẩm nghệ thuật mà các mô hình ngôn ngữ lớn đã được huấn luyện dựa trên đó. Đối với tác giả Kirk Wallace Johnson, người mà các cuốn sách phi hư cấu đã tiêu tốn nhiều năm nghiên cứu và đi lại, sự thật này mang tính cá nhân sâu sắc. Ông phát hiện ra rằng chính những từ ngữ mà ông đã dành cả thập kỷ để hoàn thiện lại là một phần của dữ liệu cung cấp sức mạnh cho các chatbot có thể tái tạo phong cách của ông theo yêu cầu, mà không có bất kỳ khoản tiền bản quyền hay sự công nhận nào.

Trải nghiệm của Johnson không phải là một sự cố đơn lẻ. Các nhà sáng tạo trong các lĩnh vực văn học, minh họa, âm nhạc và điện ảnh đang báo cáo rằng các sản phẩm có bản quyền của họ đã bị thu hoạch hàng loạt. Thực trạng này, mà những người trong ngành mô tả là việc trích xuất có hệ thống các "tập dữ liệu vi phạm bản quyền", đã biến sự lo ngại thành các hành động pháp lý có phối hợp. Các nghệ sĩ hiện lập luận rằng giá trị mà họ tạo ra đang bị hút vào các tập đoàn công nghệ "giàu nứt đố đổ vách", những đơn vị thu lợi từ sức lao động của họ trong khi những người sáng tạo không nhận được gì.

Những vụ kiện đang định hình cuộc chiến

Cuộc tấn công pháp lý đang nhắm vào cốt lõi của cách thức xây dựng các mô hình AI tạo sinh. Các nguyên đơn không chỉ nộp đơn kiện vì vi phạm bản quyền mà còn vì vi phạm các điều khoản dịch vụ của chính các nền tảng đó. Họa sĩ minh họa và họa sĩ truyện tranh Sarah Andersen, người có các tác phẩm đã trở thành một phần không thể thiếu của văn hóa internet, là một trong những nghệ sĩ thị giác đầu tiên đệ đơn kiện trực tiếp một công ty AI. Đơn kiện của cô lập luận rằng khả năng bắt chước nét vẽ và phong cách hài hước đặc trưng của mô hình này đang làm xói mòn thị trường cho các tác phẩm truyện tranh gốc của cô, biến thương hiệu của cô thành một nguồn tài nguyên miễn phí cho tất cả mọi người.

Các vụ việc này đang được xử lý bởi những luật sư chuyên về tranh chấp sở hữu trí tuệ và có bề dày thành tích trong việc thách thức các gã khổng lồ công nghệ. Chiến lược của họ là buộc phải tiết lộ các tập dữ liệu chính xác đã được sử dụng, buộc các công ty phải ngừng sử dụng các tài liệu đang tranh chấp và yêu cầu bồi thường thiệt hại phản ánh đúng giá trị thương mại của nội dung bị đánh cắp.

Lập luận về “sử dụng hợp lý” đang bị thách thức

Các nhà phát triển AI khẳng định rằng việc huấn luyện một mô hình trên dữ liệu công khai là một hình thức sử dụng mang tính chuyển đổi mà luật pháp bảo vệ. Họ lập luận rằng mô hình không sao chép nguyên văn bất kỳ tác phẩm đơn lẻ nào; thay vào đó, nó học các quy luật để có thể tạo ra văn bản hoặc hình ảnh mới. Từ góc độ đó, quá trình này tương tự như một nhà nghiên cứu đọc nhiều cuốn sách để thu thập kiến thức, chứ không phải là sao chép chúng.

Các nhà sáng tạo phản bác rằng sự "chuyển đổi" chỉ là một cái cớ yếu ớt khi kết quả đầu ra có thể là một bản sao gần như hoàn hảo về giọng văn của một tác giả hoặc phong cách của một nghệ sĩ. Khi một chatbot có thể trả lời câu hỏi với cùng nhịp điệu và cách dùng từ mà một tiểu thuyết gia vốn nổi tiếng, hoặc khi một trình tạo ảnh có thể tạo ra những bức hình không thể phân biệt được với danh mục tác phẩm của một họa sĩ minh họa đang còn hoạt động, thì kết quả đó đóng vai trò như một vật thay thế trên thị trường. Các nguyên đơn lập luận rằng sự thay thế này gây tổn hại đến khả năng bán sách, nhận các hợp đồng vẽ thuê và các thỏa thuận cấp phép của họ, và lập luận bào chữa về "sử dụng hợp lý" sẽ sụp đổ trước sức nặng của các tác động thương mại.

Những gì đang bị đe dọa

  • Áp lực kinh tế lên các công ty AI – Nếu tòa án phán quyết rằng việc thu thập dữ liệu (scraping) quy mô lớn vi phạm bản quyền, các công ty có thể phải đối mặt với những hậu quả tài chính đáng kể, từ đó có khả năng thúc đẩy những thay đổi trong các quy trình xử lý dữ liệu (data pipelines).

  • Hồ sơ tòa án và quá trình cung cấp chứng cứ – Đợt tài liệu tiếp theo sẽ tiết lộ chính xác những tác phẩm và hình ảnh nào đã được sử dụng, mang lại một cái nhìn rõ ràng hơn về quy mô của việc thu hoạch dữ liệu.