Gemini AI của Google đang đối mặt với một vụ kiện tập thể được đệ trình tại tòa án liên bang New York, cáo buộc công ty này đã huấn luyện các mô hình của mình dựa trên các sách và bài báo có bản quyền mà không có sự cho phép. Đơn khiếu nại, được đưa ra bởi một liên minh bao gồm các nhà xuất bản lớn và tác giả Scott Turow, cho rằng Google đã cố tình loại bỏ thông tin bản quyền để che giấu việc sử dụng "các tài liệu bị đánh cắp" trong hệ thống AI tạo sinh của mình.
Vụ kiện và các cáo buộc cốt lõi
Hồ sơ tại Tòa án Quận Hoa Kỳ cho Quận phía Nam New York liệt kê Hachette, Cencage, Elsevier, tập thể S.C.R.I.B.E. và Turow là các nguyên đơn. Họ cáo buộc Google đã vượt quá thỏa thuận "chỉ hiển thị đoạn trích" (snippet-only) vốn được áp dụng cho Google Books, bằng cách sử dụng toàn bộ văn bản từ kho lưu trữ đó và từ các tác phẩm được tải lên Google Play để huấn luyện Gemini. Theo đơn khiếu nại, Google không chỉ thu thập nội dung mà còn thay đổi hoặc xóa bỏ siêu dữ liệu (metadata) bản quyền, một bước đi mà các nguyên đơn cho rằng nhằm mục đích che giấu hành vi vi phạm.
Một bản ghi nhớ nội bộ của Google được nhắc đến trong vụ kiện cảnh báo rằng việc sử dụng các sách có bản quyền để huấn luyện AI có thể "gây ra vấn đề nghiêm trọng" và khiến công ty phải đối mặt với các khoản phạt từ 10 tỷ đến 100 tỷ USD. Các nguyên đơn dẫn chứng mức phạt 1,5 tỷ USD gần đây đối với một công ty AI khác vì sử dụng dữ liệu trái phép như một cột mốc cho quy mô trách nhiệm pháp lý tiềm tàng.
Diễn biến dẫn đến sự việc
Mối quan hệ giữa Google và các nhà xuất bản sách bắt đầu với Google Books, một chỉ mục có thể tìm kiếm, hiển thị các đoạn trích ngắn và chi tiết thư mục trong khi vẫn giữ toàn bộ văn bản sau một bức tường phí (paywall). Mô hình đó dựa trên các thỏa thuận cấp phép giới hạn Google chỉ được hiển thị các đoạn trích. Qua nhiều năm, Google đã mở rộng phạm vi sở hữu thông qua cửa hàng Google Play, nơi các nhà xuất bản và tác giả tải lên các sách điện tử toàn văn để bán.
Các nguyên đơn lập luận rằng sự chuyển dịch của Google từ một dịch vụ lập chỉ mục "giới hạn phạm vi" sang một nguồn dữ liệu để huấn luyện các mô hình ngôn ngữ lớn (LLM) đã vi phạm các thỏa thuận ban đầu. Họ cho rằng công ty chưa bao giờ có được các quyền cho phép rộng rãi cần thiết để đưa toàn bộ tác phẩm vào quy trình huấn luyện của Gemini.
Những gì đang bị đe dọa đối với Google và ngành công nghiệp AI
Nếu tòa án phán quyết rằng việc sử dụng tài liệu có bản quyền mà không có giấy phép là vi phạm luật bản quyền, quyết định này có thể định hình lại cách các nhà phát triển AI thu thập dữ liệu huấn luyện.
Các phương án bào chữa và phản biện có thể xảy ra
Google có khả năng sẽ dựa vào học thuyết "sử dụng hợp lý" (fair use), cho phép sử dụng hạn chế các tài liệu có bản quyền để bình luận, phê bình hoặc chuyển đổi. Các phán quyết gần đây tại California đã coi việc huấn luyện AI là một hoạt động mang tính chuyển đổi, trao cho nó sự bảo hộ của nguyên tắc sử dụng hợp lý. Các nguyên đơn tại New York đã nộp đơn ngoài phạm vi quyền hạn đó để tránh các tiền lệ này.
Các nguyên đơn phản bác rằng việc xóa siêu dữ liệu bản quyền cho thấy ý định che giấu nguồn gốc, làm suy yếu bất kỳ tuyên bố nào về việc chuyển đổi dựa trên thiện chí. Họ cũng dẫn chứng bản ghi nhớ nội bộ như một bằng chứng cho thấy Google đã nhận thức được rủi ro pháp lý.
Những diễn biến cần theo dõi tiếp theo
Vụ kiện sẽ trải qua các kiến nghị trước xét xử, điều này có thể định hình các lập luận của cả hai bên, bao gồm việc liệu tòa án sẽ áp dụng phân tích "sử dụng hợp lý" như ở California hay áp dụng một tiêu chuẩn khác. Một phán quyết về thẩm quyền xét xử có thể quyết định liệu các tòa án tại New York có trở thành địa điểm chính cho các tranh chấp bản quyền liên quan đến AI hay không.
Điểm mấu chốt: Vụ kiện tại New York chống lại Gemini của Google có thể vẽ lại ranh giới giữa việc sử dụng dữ liệu được cho phép và vi phạm bản quyền, buộc các nhà phát triển AI phải suy nghĩ lại về cách họ thu thập nguyên liệu thô để vận hành các mô hình của mình, đồng thời định hình lại nền kinh tế của toàn bộ ngành công nghiệp.
