Các nhà nghiên cứu AI đã phát hiện ra một nỗ lực có phối hợp của một mạng lưới gồm khoảng 150 trang tin tức có lưu lượng truy cập thấp nhằm làm tràn ngập dữ liệu huấn luyện mô hình ngôn ngữ lớn (LLM) bằng các luận điệu ủng hộ Điện Kremlin. Các trang web này, được gọi chung là mạng lưới Pravda, xuất bản khoảng ba triệu bài báo mỗi năm, và nội dung của chúng hiện đang xuất hiện trong tập dữ liệu Common Crawl — nguồn cung cấp dữ liệu cho nhiều hệ thống AI thương mại.
Cách thức hoạt động của quy trình thông tin sai lệch
Mạng lưới Pravda không nhằm mục đích thu hút người đọc là con người. Thay vào đó, mỗi trang web xuất bản các bài báo lặp đi lặp lại với một bộ luận điểm hẹp. Bằng cách nhồi nhét văn bản với các từ khóa mà các công cụ tìm kiếm và trình thu thập dữ liệu web ưu tiên, các trang web này làm tăng khả năng một mô hình AI sẽ bắt gặp chúng trong quá trình thu thập dữ liệu.
Có hai cơ chế đầu độc đang diễn ra:
- Đầu độc tại thời điểm truy xuất (Retrieval-time poisoning) – Khi một trợ lý AI lấy thông tin trực tiếp từ web, nó có thể hiển thị một bài báo của Pravda bên cạnh các nguồn tin chính thống. Việc chặn các tên miền độc hại đã biết có thể hạn chế sự tiếp xúc này.
- Đầu độc tại thời điểm huấn luyện (Training-time poisoning) – Nếu các bài báo này lọt vào các kho ngữ liệu lớn được sử dụng để tiền huấn luyện một mô hình, các tuyên bố sai sự thật sẽ trở thành một phần kiến thức nội tại của mô hình đó. Việc loại bỏ những nội dung như vậy sau khi sự việc đã rồi là khó khăn hơn nhiều.
Các nhà nghiên cứu đã lần theo các bài báo của Pravda bên trong Common Crawl, một kho lưu trữ công khai được sử dụng để huấn luyện nhiều mô hình AI. Điều đó có nghĩa là việc đầu độc không còn là giả thuyết; nó đã làm thay đổi cơ sở kiến thức của các mô hình mà nhiều người dùng đang tin dùng hiện nay.
Tại sao điều này lại quan trọng
Đừng tin AI chỉ vì nó nói "nhiều nguồn tin đồng thuận." Nếu bạn xây dựng các công cụ AI, hãy sử dụng danh sách chặn (blocklists) cho các trang thông tin sai lệch đã biết. Đừng sử dụng "số lượng lượt đề cập" như một cách để đo lường sự thật. Số lượng không đồng nghĩa với chất lượng. Hãy xác minh mọi thứ AI nói với bạn, đặc biệt nếu nó có vẻ thiên kiến.
Internet chính là tập dữ liệu huấn luyện cho công nghệ tương lai của chúng ta. Bất kỳ ai có trang web đều có thể cố gắng làm sai lệch các cỗ máy mà chúng ta đang dựa vào.
Những gì nhà phát triển có thể làm ngay bây giờ
- Duy trì danh sách chặn (blocklists) – Thêm các tên miền thông tin sai lệch đã biết vào bộ lọc thu thập dữ liệu; danh sách chặn sẽ ngăn chặn cả việc tiếp xúc tại thời điểm truy xuất và thời điểm huấn luyện.
- Tư duy lại về các phương pháp suy nghiệm dựa trên tần suất (frequency heuristics) – Ngừng đánh đồng số lượng lượt đề cập với tính xác thực. Một tuyên bố được lặp lại trên hàng chục trang web chất lượng thấp có thể "áp đảo" một nguồn tin uy tín duy nhất trong một mô hình dựa trên tần suất ngây thơ.
- Áp dụng kiểm tra nguồn gốc (provenance checks) – Truy vết thông tin về nguồn gốc ban đầu của nó. Nếu chuỗi thông tin kết thúc tại một trang web có lưu lượng truy cập không đáng kể và có lịch sử tuyên truyền, hãy gắn cờ kết quả đầu ra để xem xét.
- Triển khai làm sạch sau huấn luyện (post-training sanitization) – Thực hiện các đợt kiểm tra được tuyển chọn đối với kết quả đầu ra của mô hình liên quan đến các chủ đề nhạy cảm về chính trị. Những người đánh giá là con người có thể phát hiện ra sự thiên kiến có hệ thống mà các bộ lọc tự động bỏ lỡ.
Các quan điểm phản biện và thách thức
Việc cân bằng giữa tính bảo mật và tính bao trùm vẫn là một vấn đề chưa có lời giải.
Nhìn về tương lai
Mạng lưới Pravda cho thấy cách các tác nhân nhà nước có thể vũ khí hóa web mở để định hình thế hệ AI tiếp theo.
Kết luận: Sự toàn vẹn của AI phụ thuộc vào độ sạch của dữ liệu mà nó học hỏi. Một làn sóng phối hợp của các trang web có lưu lượng truy cập thấp và đầy rẫy tuyên truyền có thể đã sớm nhúng các thông tin sai lệch vào các mô hình mà chúng ta tin tưởng. Các nhà phát triển phải coi uy tín của nguồn tin là một mối quan tâm hàng đầu, chứ không phải là một ý nghĩ thoáng qua, để ngăn chặn các cỗ máy chúng ta xây dựng trở thành những kẻ phát ngôn vô thức cho thông tin sai lệch.
