Thỏa thuận bồi thường vi phạm bản quyền 1,5 tỷ USD của Anthropic: Một tổn thất kỷ lục và một thắng lợi chiến lược
Anthropic đã đạt được một thỏa thuận bồi thường lịch sử trị giá 1,5 tỷ USD với một nhóm các tác giả sách sau những cáo buộc về việc sử dụng các cơ sở dữ liệu lậu để huấn luyện các mô hình của mình. Mặc dù khoản thanh toán khổng lồ này là một đòn giáng mạnh về tài chính, nhưng những sắc thái pháp lý của vụ việc thực tế có thể mang lại một chiến thắng quan trọng cho ngành công nghiệp AI nói chung liên quan đến nguyên tắc sử dụng hợp lý (fair use).
Chi tiết về thỏa thuận bồi thường phá kỷ lục
Một tòa án liên bang tại San Francisco đã phê duyệt một thỏa thuận mang tính bước ngoặt sau khi các bằng chứng tiết lộ rằng Anthropic đã tải sách từ các cơ sở dữ liệu lậu khét tiếng, cụ thể là LibGen và PiLiMi, trong khoảng thời gian từ năm 2021 đến 2022. Quy mô của thỏa thuận này là chưa từng có trong lịch sử các vụ kiện tập thể, bao gồm khoảng 482.460 tác phẩm được liệt kê.
Trong tổng số các tác phẩm liên quan, 91,3% đã được các tác giả khiếu nại thành công. Mỗi người khiếu nại dự kiến sẽ nhận được khoảng 3.000 USD, con số này cao gấp bốn lần mức tối thiểu theo luật định. Như một phần của giải quyết pháp lý, Anthropic được yêu cầu phải tiêu hủy các tệp lậu đã được sử dụng trong giai đoạn này. Quan trọng là, thỏa thuận này không cấp cho công ty một "tấm thẻ miễn tử" toàn diện; các tác giả vẫn giữ quyền khiếu nại nếu các đầu ra của AI tái tạo lại các tác phẩm gốc hoặc nếu các hoạt động thu thập dữ liệu trong tương lai của Anthropic vi phạm luật bản quyền.
Một chi tiết kỹ thuật có lợi cho sự phát triển của AI
Bất chấp mức giá gây sốc 1,5 tỷ USD, tiền lệ pháp lý được thiết lập bởi vụ việc này lại có lợi một cách đáng ngạc nhiên cho các phòng thí nghiệm AI. Thỏa thuận này giải quyết hành vi cụ thể là sử dụng các nguồn lậu, nhưng nó không đưa ra phán quyết về tính hợp pháp của chính việc huấn luyện AI.
Thẩm phán Alsup trước đó đã thiết lập một sự phân biệt quan trọng: việc huấn luyện AI trên các cuốn sách có được một cách hợp pháp là "mang tính chuyển đổi — một cách ngoạn mục" — và hoàn toàn nằm trong học thuyết sử dụng hợp lý (fair use). Sự phân biệt này rất quan trọng đối với các công ty như OpenAI, Google và Meta. Nó cho thấy rằng mặc dù nguồn dữ liệu (vi phạm bản quyền so với thu thập hợp pháp) là một yếu tố gây rủi ro pháp lý, nhưng quy trình huấn luyện một mô hình để hiểu ngôn ngữ và các quy luật là có thể bảo vệ được về mặt pháp lý.
Ranh giới chưa được giải quyết của việc thu thập dữ liệu hàng loạt
Mặc dù phán quyết này mang lại một "phao cứu sinh" cho các phòng thí nghiệm đã huấn luyện trên các tập dữ liệu khổng lồ, nhưng cuộc chiến pháp lý về việc "thu thập hợp pháp" vẫn còn lâu mới kết thúc. Câu hỏi trọng tâm vẫn là: liệu việc thu thập hàng loạt nội dung trên internet mà không có sự đồng ý rõ ràng từ chủ sở hữu trang web cấu thành việc thu thập hợp pháp hay là vi phạm bản quyền?
Thỏa thuận này làm nổi bật một thực tế pháp lý phân đôi đối với ngành công nghiệp AI. Các công ty có thể tránh được các hình phạt khổng lồ bằng cách đảm bảo các đường ống dữ liệu (data pipelines) của họ được làm sạch khỏi các kho lưu trữ lậu đã biết, nhưng họ vẫn phải đối mặt với một bối cảnh không chắc chắn liên quan đến quyền của các nhà xuất bản web và những người sáng tạo nội dung. Khi các phòng thí nghiệm AI tiếp tục mở rộng quy mô, sự căng thẳng giữa tiến bộ công nghệ mang tính chuyển đổi và quyền sở hữu trí tuệ sẽ vẫn là rào cản pháp lý lớn nhất của ngành.
Các điểm chính cần lưu ý
- Khoản thanh toán kỷ lục: Anthropic sẽ trả 1,5 tỷ USD cho các tác giả sau khi sử dụng các cơ sở dữ liệu lậu như LibGen, đánh dấu thỏa thuận bản quyền lớn nhất trong lịch sử các vụ kiện tập thể.
- Tiền lệ sử dụng hợp lý: Tòa án khẳng định rằng việc huấn luyện AI trên dữ liệu thu thập hợp pháp là "mang tính chuyển đổi một cách ngoạn mục", cung cấp một lá chắn pháp lý lớn cho việc huấn luyện AI hợp pháp.
- Tính toàn vẹn của dữ liệu là then chốt: Phán quyết nhấn mạnh rằng tính hợp pháp của việc huấn luyện AI thường phụ thuộc vào nguồn gốc của dữ liệu huấn luyện hơn là bản thân quy trình huấn luyện.
