Tại sao vụ kiện lại đưa ra tòa

ANI đã khởi kiện sau khi nhận thấy các câu trả lời của ChatGPT cho các truy vấn về tin tức Ấn Độ gần đây có sự tương đồng với các bài báo của chính họ được xuất bản vào tháng 8 và tháng 9 năm 2024. Cơ quan thông tấn này lập luận rằng mô hình ngôn ngữ lớn đang sao chép các văn bản có bản quyền của họ, một cáo buộc mà nếu được giữ nguyên, sẽ buộc OpenAI phải tạm dừng hoặc hạn chế nghiêm ngặt các mô hình của mình tại Ấn Độ.

OpenAI phản hồi rằng hai mô hình được trích dẫn—GPT-4 và GPT-4o mới hơn—được huấn luyện trên dữ liệu có ngày cắt (cut-off dates) là tháng 4 năm 2022 và tháng 4 năm 2024. Các bài báo của ANI xuất hiện sau những ngày đó, vì vậy chúng không thể nằm trong tập dữ liệu huấn luyện ban đầu. Thẩm phán Amit Bansal cho biết sự trùng lặp này rất có thể đến từ Retrieval-Augmented Generation (RAG), một kỹ thuật lấy nội dung web hiện tại vào câu trả lời trong thời gian thực, chứ không phải do mô hình "ghi nhớ" các bài báo.

Bước ngoặt pháp lý: huấn luyện như một hình thức "nghiên cứu"

Vụ kiện này quan trọng vì tòa án đã diễn giải rộng rãi ngoại lệ bản quyền của Ấn Độ dành cho "sử dụng riêng tư hoặc cá nhân, bao gồm cả nghiên cứu". Cả hai bên đều đồng ý rằng OpenAI đã sử dụng tài liệu của ANI trong giai đoạn huấn luyện ban đầu, nhưng thẩm phán đã coi việc sử dụng đó là mang tính "chuyển đổi" (transformative). Nói cách khác, mô hình chỉ trích xuất ngữ pháp, cú pháp và các mẫu thống kê, để nguyên nội dung biểu đạt mà không chạm tới.

Tòa án đã đặt ra hai điều kiện nghiêm ngặt:

  • Các bản sao được sử dụng để huấn luyện phải đến từ các nguồn hợp pháp, không phải từ các kho lưu trữ lậu hoặc các tường phí (paywalls) mà người dùng không thể truy cập.
  • Tài liệu phải được giữ trong môi trường riêng của nhà phát triển; không được phép xuất bản hoặc phân phối.

Áp dụng bài kiểm tra tính công bằng gồm ba phần, thẩm phán nhận thấy việc sử dụng của OpenAI chỉ giới hạn ở việc huấn luyện, không thấy bằng chứng cho thấy mô hình đã ghi nhớ nguyên văn các đoạn văn, và lưu ý rằng ANI không chịu tổn thất kinh tế trực tiếp vì hai công ty hoạt động trong các phân khúc thị trường khác nhau.

Vụ việc này nằm trong bối cảnh các phán quyết toàn cầu đa dạng

Quan điểm của Ấn Độ hiện đang phản chiếu một số vụ kiện tại Hoa Kỳ vốn ủng hộ quan điểm mang tính chuyển đổi đối với các đầu ra của AI. Trong vụ Kadrey v. Meta, tòa án đã phán quyết rằng văn bản được tạo ra mà không sao chép chính xác câu chữ thì không vi phạm, trong khi quyết định lâu đời trong vụ Google Books đã công nhận một ngoại lệ "tìm kiếm và hiển thị" hạn chế cho các dự án số hóa. Các vụ kiện khác tại Hoa Kỳ, chẳng hạn như vụ Raw Story, đã bị bác bỏ do thiếu bằng chứng về thiệt hại có thể chứng minh được, nhưng tranh cãi về Anthropic đã nhắc nhở các thẩm phán rằng việc sử dụng dữ liệu lậu vẫn có thể dẫn đến trách nhiệm pháp lý.

Tại Châu Âu, các ý kiến đang phân hóa mạnh mẽ. Các tòa án ở Munich đã phán quyết rằng việc tái tạo lời bài hát được nhúng trong các trọng số (weights) của mô hình cấu thành hành vi vi phạm, trong khi một hội đồng trọng tài ở London gần đây đã bác bỏ khiếu nại chống lại Stability AI dựa trên các căn cứ tương tự. Phán quyết của Tòa án Tối cao Delhi đã bổ sung thêm một dữ liệu mới: nếu việc huấn luyện chỉ giới hạn ở các nguồn hợp pháp và đầu ra không phải là bản sao nguyên văn, hoạt động đó có thể thuộc phạm vi ngoại lệ nghiên cứu.

Những điều nhà phát triển cần lưu ý

  • RAG so với huấn luyện – Sự phân biệt của tòa án giữa "ghi nhớ" (huấn luyện) và truy xuất thời gian thực (RAG) cho thấy các tranh chấp trong tương lai sẽ tập trung vào việc liệu một câu trả lời đến từ một cơ sở kiến thức tĩnh hay được lấy trực tiếp từ web. Các nhà phát triển có thể cần làm rõ ranh giới đó trong tài liệu sản phẩm.
  • Nguồn gốc nguồn dữ liệu – Yêu cầu về "nguồn hợp pháp" có thể thúc đẩy các công ty thắt chặt quy trình tuyển chọn dữ liệu, sử dụng các hợp đồng hoặc giấy phép để chứng minh mỗi phần văn bản đều hợp lệ.
  • Chỉ sử dụng nội bộ – Các công ty có kế hoạch thương mại hóa đầu ra của mô hình phải giữ dữ liệu huấn luyện nghiêm ngặt trong nội bộ. Việc chia sẻ các kho ngữ liệu thô với đối tác hoặc công chúng có thể làm suy yếu khả năng bào chữa dựa trên mục đích nghiên cứu.
  • Kiểm tra thiệt hại kinh tế – Vì tòa án nhấn mạnh vào việc không có tổn thất tài chính trực tiếp, những người khiếu nại sẽ cần phải chứng minh được tổn thất cụ thể, chứ không chỉ là sự suy giảm giá trị thương hiệu theo cảm nhận.
  • Phản ứng lập pháp – Các nhà lập pháp Ấn Độ đang theo dõi các cuộc tranh luận về bản quyền liên quan đến AI. Bất kỳ sửa đổi nào làm thu hẹp ngoại lệ nghiên cứu đều có thể ảnh hưởng hồi tố đến các mô hình đã được triển khai, dẫn đến một làn sóng kiểm tra tuân thủ.

Đối luận vẫn đang ám ảnh AI

Khiếu nại của ANI đã làm nổi bật một mối lo ngại thực sự: khi các LLM ngày càng trở nên thành thạo trong việc lặp lại các cách diễn đạt cụ thể, ranh giới giữa việc sử dụng "chuyển đổi" và "sao chép" có thể trở nên mờ nhạt. Các nhà phê bình lập luận rằng RAG, mặc dù về mặt kỹ thuật là một chức năng tìm kiếm, vẫn hiển thị nội dung có bản quyền mà không có sự cho phép, có khả năng vi phạm quyền "truyền đạt tới công chúng".

Một tiền lệ với những tác động lan tỏa toàn cầu

Bằng cách phân loại việc huấn luyện mô hình là một hoạt động nghiên cứu được cho phép, Tòa án Tối cao Delhi đã phát đi tín hiệu rằng Ấn Độ sẽ không tự động ngăn chặn việc phát triển các mô hình ngôn ngữ lớn dựa trên các căn cứ về bản quyền, miễn là các nhà phát triển tôn trọng tính hợp pháp của nguồn dữ liệu và giữ việc huấn luyện trong phạm vi nội bộ. Cách diễn giải này có thể khuyến khích các công ty mở rộng hoạt động tại Ấn Độ, khi biết rằng một rào cản pháp lý quan trọng đã được nới lỏng.

Đối với các cơ quan quản lý ở những nơi khác, phán quyết này cung cấp một khuôn mẫu: xác định một ngoại lệ nghiên cứu hẹp và được ghi chép rõ ràng, áp đặt các tiêu chuẩn nguồn dữ liệu minh bạch và yêu cầu chỉ xử lý dữ liệu huấn luyện nội bộ. Các quốc gia áp dụng ngôn ngữ tương tự có thể mang lại cho hệ sinh thái AI trong nước sự chắc chắn cần thiết để thu hút đầu tư.

Điểm mấu chốt: Quyết định của Tòa án Tối cao Delhi không trao toàn quyền thu thập bất kỳ văn bản nào để huấn luyện AI, nhưng nó xác lập rằng, theo luật pháp Ấn Độ, việc huấn luyện có kỷ luật và tuân thủ pháp luật được coi là nghiên cứu. Cách diễn giải đó có thể trở thành một điểm tham chiếu cho các tòa án trên toàn thế giới khi họ phải đối mặt với việc liệu dạy máy móc hiểu ngôn ngữ là một hoạt động học thuật được bảo vệ hay là một hành vi vi phạm tiềm tàng.