NYT cáo buộc OpenAI che giấu bằng chứng trong vụ kiện bản quyền lớn

Cuộc chiến pháp lý đang diễn ra giữa The New York Times và OpenAI đã có một bước ngoặt đầy kịch tính, với những cáo buộc rằng gã khổng lồ AI đã cố tình che giấu bằng chứng liên quan đến các tập dữ liệu huấn luyện của mình. Sự leo thang này đe dọa sẽ chuyển trọng tâm của vụ kiện từ vi phạm bản quyền sang tính trung thực của quá trình cung cấp chứng cứ (discovery process) trong tư pháp.

Cáo buộc về các hành vi dữ liệu gian lận

The New York Times và The Daily News khẳng định rằng OpenAI đã không trung thực về khả năng kỹ thuật trong việc tìm kiếm cả kho dữ liệu huấn luyện (training corpus) lẫn nhật ký trò chuyện của khách hàng. Trong suốt hai năm tranh tụng, OpenAI luôn duy trì lập trường rằng việc tìm kiếm trong các tập dữ liệu khổng lồ của họ sẽ gây gánh nặng về mặt kỹ thuật và làm tổn hại đến quyền riêng tư của người dùng.

Tuy nhiên, một bản lấy lời khai (deposition) gần đây từ kỹ sư quyền riêng tư dữ liệu của OpenAI, Vinnie Monaco, đã thách thức lập luận này. Monaco được cho là đã tiết lộ rằng OpenAI thực tế đã thực hiện các cuộc tìm kiếm nội bộ trong kho dữ liệu huấn luyện của mình nhằm mục đích xác định các tác phẩm báo chí có bản quyền. Hơn nữa, bản lấy lời khai cũng gợi ý rằng OpenAI đã thu thập một cơ sở dữ liệu gồm khoảng 78 triệu cuộc hội thoại ChatGPT đã được ẩn danh để đánh giá nội bộ mức độ vi phạm bản quyền tiềm ẩn.

Dự án Giraffe và bộ lọc "Bloom"

Có lẽ tiết lộ kỹ thuật quan trọng nhất liên quan đến "Project Giraffe", một bộ công cụ được triển khai bởi OpenAI. Theo các nguyên đơn, ngay sau khi vụ kiện được đệ trình, OpenAI đã sử dụng bộ lọc "Bloom" như một phần của dự án này để phát hiện và ghi lại các trường hợp "regurgitation" (nhai lại) — tức là khi mô hình tái hiện nguyên văn nội dung có bản quyền trong các phản hồi của nó.

Sự tồn tại của Project Giraffe mâu thuẫn với lập trường trước đó của OpenAI rằng việc xác định các trường hợp tái hiện nội dung cụ thể trong nhật ký của họ là một nhiệm vụ bất khả thi. Các nguyên đơn lập luận rằng những công cụ này chứng minh OpenAI không chỉ có khả năng giám sát vi phạm bản quyền mà còn đang tích cực xây dựng cơ sở hạ tầng để theo dõi việc đó.

Tranh chấp về tính toàn vẹn của dữ liệu và quá trình cung cấp chứng cứ

Xung đột cũng tập trung vào chất lượng dữ liệu được cung cấp cho tòa án. Trong khi các nguyên đơn ban đầu yêu cầu một mẫu gồm 120 triệu nhật ký trò chuyện, OpenAI đã thương lượng để giảm con số này xuống còn 20 triệu. Khi mẫu này cuối cùng được nộp vào tháng 12, tòa án được cho là đã thấy nó "không thể sử dụng được" do bị che mờ (redaction) quá mức.

NYT còn đi xa hơn khi cáo buộc rằng OpenAI đã xóa hàng tỷ phản hồi của ChatGPT, vi phạm lệnh bảo tồn dữ liệu của tòa án, và đã thay thế hàng triệu nhật ký trong mẫu được cung cấp. Đáp lại, người phát ngôn của OpenAI, Drew Pusateri, đã phủ nhận mọi cáo buộc, đồng thời cáo buộc tờ Times đang cố gắng xâm phạm quyền riêng tư của người dùng khi vụ kiện của họ đang yếu dần.

Tại sao điều này lại quan trọng đối với ngành công nghiệp AI

Vụ kiện này là một chỉ dấu cho tương lai của việc phát triển AI tạo sinh (generative AI) và các ranh giới pháp lý của "sử dụng hợp lý" (fair use). Nếu tòa án kết luận rằng OpenAI đã che giấu bằng chứng hoặc thao túng quá trình cung cấp chứng cứ, điều này có thể tạo ra một tiền lệ về cách các công ty AI được yêu cầu công khai phương pháp huấn luyện và nguồn gốc dữ liệu của họ. Đối với các nhà phát triển và những người sáng lập AI, kết quả này sẽ làm rõ mức độ minh bạch cần thiết khi điều hướng điểm giao thoa giữa việc nạp dữ liệu khổng lồ và quyền sở hữu trí tuệ.

Các điểm chính cần lưu ý

  • Công cụ giám sát nội bộ: Các cáo buộc cho thấy OpenAI đã sử dụng "Project Giraffe" và bộ lọc "Bloom" để chủ động theo dõi việc tái hiện các nội dung có bản quyền.
  • Lời khai mâu thuẫn: Bằng chứng từ bản lấy lời khai cho thấy OpenAI sở hữu khả năng kỹ thuật để tìm kiếm dữ liệu huấn luyện, mâu thuẫn với những tuyên bố trước đó về gánh nặng kỹ thuật.
  • Tính trung thực của quá trình cung cấp chứng cứ đang bị đe dọa: Vụ kiện hiện xoay quanh việc liệu OpenAI có vi phạm các lệnh bảo tồn bằng cách xóa các phản hồi và cung cấp các mẫu dữ liệu đã bị che mờ "không thể sử dụng được" hay không.