Google DeepMind đã triển khai một chương trình thí điểm sử dụng phương pháp đánh giá mù đôi bằng mật mã học (cryptographic double-blind benchmarking) để đánh giá các mô hình Gemini Flash Lite mà không làm lộ các câu lệnh kiểm tra (test prompts) hoặc trọng số mô hình (model weights). Quá trình đánh giá diễn ra bên trong Confidential Space của Google Cloud, vì vậy bên đánh giá không bao giờ nhìn thấy mô hình và mô hình cũng không bao giờ nhìn thấy các câu hỏi—một cách tiếp cận có thể khôi phục uy tín cho các báo cáo hiệu suất AI.

Tại sao sự nhiễm bẩn bộ chuẩn đánh giá lại quan trọng

Nếu một mô hình được huấn luyện trên dữ liệu mà sau đó xuất hiện trong một bộ chuẩn đánh giá (benchmark), điểm số của nó sẽ không còn đo lường khả năng suy luận nữa mà trở thành khả năng ghi nhớ. Do đó, một kết quả hoàn hảo trên một bài kiểm tra bị nhiễm bẩn sẽ không nói lên được năng lực thực sự. Các nhà nghiên cứu từ lâu đã phải đối mặt với một nghịch lý: họ phải bàn giao dữ liệu kiểm tra cho nhà cung cấp mô hình để xác minh bộ chuẩn, với rủi ro bị lộ dữ liệu sớm, hoặc họ phải từ chối quyền truy cập bên ngoài để bảo vệ các trọng số độc quyền, khiến việc kiểm toán không thể được xác minh. Sự chậm trễ gần đây trong việc đánh giá Fable 5 của Anthropic trên bộ chuẩn ARC-AGI cho thấy các chính sách lưu trữ dữ liệu nghiêm ngặt có thể làm đình trệ việc đánh giá độc lập như thế nào.

Một giải pháp mật mã học

Chương trình thí điểm này thay thế các hợp đồng pháp lý và những lời hứa "không lưu nhật ký" bằng một biện pháp bảo vệ kỹ thuật. Confidential Space tạo ra một vùng thực thi cô lập bằng phần cứng (enclave) để chạy mô hình Gemini Flash Lite. Bên đánh giá tải lên bộ kiểm tra, và enclave này sẽ niêm phong nó trong một "chiếc hộp" mật mã mà mô hình không thể mở ra. Đồng thời, các trọng số của mô hình vẫn được mã hóa bên trong enclave, khiến bên đánh giá không thể nhìn thấy. Enclave sẽ tạo ra một bằng chứng toán học chứng minh rằng mô hình chưa bao giờ truy cập vào các câu lệnh trong quá trình suy luận (inference). Kết quả là một quy trình mù đôi thực sự: cả hai bên đều giữ kín bí mật của mình trong khi bên thứ ba nhận được một chỉ số hiệu suất có thể xác minh.

Những ai sẽ được hưởng lợi

  • Các cơ quan quản lý và kiểm toán giờ đây có thể yêu cầu bằng chứng về năng lực mà không buộc các nhà cung cấp phải tiết lộ bí mật thương mại.
  • Các doanh nghiệp trong lĩnh vực an ninh mạng, quốc phòng hoặc bất kỳ lĩnh vực nào xử lý dữ liệu mật có thể kiểm tra các công cụ AI mà không lo rủi ro rò rỉ dữ liệu.
  • Các nhà phát triển mô hình giữ được lợi thế cạnh tranh; họ không còn phải lựa chọn giữa tính minh bạch và sự bảo mật.

Nếu phương pháp này được mở rộng, nó có thể trở thành phương pháp mặc định để chứng nhận các mô hình tiên phong (frontier models), chuyển đổi ngành công nghiệp từ các thỏa thuận dựa trên sự tin tưởng sang các đảm bảo dựa trên toán học.

Các điểm có thể gây trở ngại

Hệ thống này dựa trên ngăn xếp tính toán bảo mật (confidential computing stack) của Google Cloud, vì vậy các tổ chức ưu tiên các nhà cung cấp đám mây khác có thể gặp phải các rào cản về tích hợp. Việc chạy các mô hình bên trong một enclave sẽ làm tăng độ trễ và hạn chế các bộ tăng tốc phần cứng hiện có, điều này có thể ảnh hưởng đến điểm số benchmark. Ngoài ra, mặc dù bằng chứng mật mã học đảm bảo mô hình không nhìn thấy các câu lệnh, nó không ngăn chặn được các thao tác khác, chẳng hạn như tinh chỉnh (fine-tuning) sau khi bài kiểm tra bắt đầu. Các nhà phê bình có thể lập luận rằng giải pháp này chỉ giải quyết được một phần nhỏ của vấn đề rộng lớn hơn về khả năng tái lập (reproducibility).

Những điều cần theo dõi tiếp theo

  • Việc áp dụng ngoài phạm vi thí điểm – các phòng thí nghiệm AI và nhà cung cấp đám mây khác có thể xây dựng các enclave tương thích, nhằm kiểm tra xem liệu mô hình có thể được kiểm toán trên nhiều nền tảng khác nhau hay không.
  • Các tổ chức thiết lập tiêu chuẩn – các nhóm an toàn AI có thể mã hóa các cuộc kiểm toán mật mã học mù đôi thành một phần của các khung chứng nhận.
  • Sự đánh đổi về hiệu suất – các đợt chạy benchmark trong thế giới thực sẽ tiết lộ liệu chi phí vận hành (overhead) của việc thực thi bảo mật có chấp nhận được đối với các mô hình quy mô lớn hay không.

Điểm mấu chốt

Bằng cách khóa cả dữ liệu kiểm tra và mô hình bên trong một môi trường mật mã học mà cả hai bên đều không thể nhìn thấu nhau, chương trình thí điểm của Google DeepMind cung cấp một con đường cụ thể hướng tới việc đánh giá AI đáng tin cậy. Phương pháp này không loại bỏ mọi thách thức kiểm toán, nhưng nó loại bỏ nguồn gốc gây thiên kiến rõ rệt nhất—sự nhiễm bẩn bộ chuẩn đánh giá—mà không buộc bên nào phải từ bỏ các tài sản quý giá nhất của mình. Nếu cộng đồng đón nhận kỹ thuật này, các báo cáo tiến bộ AI trong tương lai cuối cùng có thể được tin tưởng hoàn toàn.