Kimi K3 tụt hậu so với các mô hình tiên phong của Mỹ trong các cuộc khai thác mạng: Khoảng cách từ việc chưng cất dữ liệu (Distillation)

Một đánh giá chung giữa Viện An ninh AI Anh (UK AISI) và Trung tâm Đổi mới và Tiêu chuẩn AI Hoa Kỳ (CAISI) đã tiết lộ một khoảng cách đáng kể về khả năng trong các hoạt động tấn công mạng giữa các mô hình AI của Trung Quốc và Hoa Kỳ. Mặc dù Kimi K3 của Moonshot AI cho thấy nhiều triển vọng, nó vẫn tụt hậu đáng kể so với các mô hình tiên phong hàng đầu của Mỹ khi được giao các nhiệm vụ khai thác phần mềm phức tạp và tấn công mạng.

ExploitBench: Khoảng cách trong nghiên cứu lỗ hổng

Để đo lường kỹ năng phát triển mã khai thác, các nhà nghiên cứu đã sử dụng ExploitBench, một bộ tiêu chuẩn (benchmark) từ Đại học Carnegie Mellon bao gồm 41 lỗ hổng được tìm thấy trong công cụ V8 của Chrome sau năm 2023. Kết quả đã làm nổi bật sự phân hóa hiệu suất rõ rệt. Các mô hình hàng đầu của Mỹ đạt điểm trung bình là 76,2%, trong khi Kimi K3 đạt điểm thấp hơn đáng kể ở mức 32,2%. Mặc dù Kimi K3 vượt qua GLM-5.2 của Trung Quốc (24,4%), nó đã thất bại trong việc đạt đến mức độ khai thác cao nhất: Thực thi mã tùy ý (Arbitrary Code Execution - ACE).

Ngược lại, các mô hình hàng đầu của Mỹ đã thực hiện thành công ACE trong 20 trên 41 nhiệm vụ được thử nghiệm, cho phép kiểm soát hoàn toàn các hệ thống mục tiêu—một mức độ tinh vi mà Kimi K3 không thể sao chép.

Mô phỏng tấn công mạng thông qua "The Last Ones"

Cuộc đánh giá cũng thử nghiệm các mô hình bằng cách sử dụng "The Last Ones" (TLO), một mô phỏng cuộc tấn công mạng doanh nghiệp phức tạp gồm 32 bước, liên quan đến 20 máy chủ (hosts) trên bốn mạng con (subnets). Bài kiểm tra này được thiết kế để đo lường khả năng của một tác nhân (agent) trong việc điều hướng các lộ trình xâm nhập đa giai đoạn.

Kimi K3 đạt trung bình 17 bước trên tổng số 32 bước, cho thấy khả năng ở mức trung bình. Mặc dù nó đã hoàn thành toàn bộ lộ trình tấn công trong một trên mười lần thử, nhưng nó thiếu sự nhất quán so với các mô hình của Mỹ, vốn đạt trung bình 28,5 bước. Các phát hiện cho thấy rằng mặc dù Kimi K3 có khả năng tự chủ tấn công các hệ thống doanh nghiệp có khả năng phòng thủ yếu, nhưng nó thiếu độ tin cậy của các mô hình tiên phong phương Tây để thực hiện các hoạt động chuỗi dài (long-chain operations) tinh vi.

Thuyết chưng cất (Distillation Theory): Tại sao lại có khoảng cách này

Một câu hỏi quan trọng vẫn còn đó: tại sao các mô hình Trung Quốc lại tụt hậu trong các tác vụ mạng ngay cả khi chúng thể hiện tốt trên các bộ tiêu chuẩn chung? Báo cáo gợi ý rằng điều này có thể là do "chưng cất" (distillation)—phương pháp sử dụng các đầu ra chất lượng cao từ các mô hình tiên phong (như Claude của Anthropic) làm dữ liệu đào tạo.

Nếu Moonshot AI đã sử dụng phương pháp chưng cất để đào tạo Kimi K3, họ có khả năng đã bỏ lỡ các dữ liệu tấn công mạng quan trọng. Các mô hình hàng đầu của Mỹ sử dụng các bộ phân loại an toàn nghiêm ngặt để chặn các truy vấn tấn công nâng cao. Do đó, một tập dữ liệu được xây dựng từ các đầu ra công khai của các mô hình này sẽ tự nhiên bị thiếu hụt chính những kiến thức cần thiết cho việc khai thác cấp độ cao. Điều này giải thích tại sao Kimi K3 có thể sánh ngang với các mô hình phương Tây về lập trình và suy luận chung nhưng lại thất bại đáng kể trong các tác vụ tấn công mạng chuyên biệt.

Năng lực đang tăng trưởng và những rủi ro dai dẳng

Bất chấp khoảng cách hiện tại, phân tích chuỗi thời gian của CAISI cho thấy cả mô hình của Mỹ và Trung Quốc đều đang trên quỹ đạo đi lên dựa trên hệ thống xếp hạng Elo. Khoảng cách hiệu suất đối với các mô hình mở đã thu hẹp từ mức sáu đến mười tháng vào đầu năm 2025 xuống chỉ còn bốn đến bảy tháng gần đây. UK AISI cảnh báo rằng khoảng cách đang thu hẹp này không đồng nghĩa với sự an toàn; năng lực ngày càng tăng của các mô hình trọng số mở (open-weight models) đại diện cho một "rủi ro lạm dụng dai dẳng và không thể đảo ngược" trong bối cảnh an ninh mạng toàn cầu.

Các điểm chính cần lưu ý

  • Khoảng cách hiệu suất mạng: Kimi K3 đạt 32,2% trên ExploitBench, tụt hậu đáng kể so với mức trung bình 76,2% của các mô hình hàng đầu của Mỹ, và không đạt được Thực thi mã tùy ý (ACE).
  • Khả năng tấn công mạng: Trong các mô phỏng TLO, Kimi K3 đạt trung bình 17 bước trong lộ trình tấn công 32 bước, chứng minh rằng nó có thể nhắm mục tiêu vào các hệ thống dễ bị tổn thương nhưng thiếu độ tin cậy của các mô hình hàng đầu của Mỹ.
  • Vai trò của việc chưng cất: Sự thiếu hụt kỹ năng mạng có thể bắt nguồn từ các phương pháp chưng cất, vì việc đào tạo trên các đầu ra công khai đã bị kiểm duyệt từ các mô hình như Claude sẽ thiếu dữ liệu tấn công cần thiết cho việc khai thác nâng cao.