Moonshot AI đã ra mắt Kimi K3 với 2,8 nghìn tỷ tham số vào tháng 7 năm 2026, và mô hình này ngay lập tức đứng đầu bảng xếp hạng Frontend Code Arena, đánh bại Claude Fable 5 và GPT-5.6 Sol trong cuộc bình chọn ẩn danh từ các nhà phát triển. Chiến thắng này có ý nghĩa quan trọng vì nó cho thấy một mô hình trọng số mở (open-weight model) có thể vượt qua các lựa chọn thay thế đóng nổi tiếng nhất trong các tác vụ lập trình thực tế.

Tại sao Kimi K3 lại quan trọng

Các mô hình trọng số mở (open-weight models)—những mô hình được công bố toàn bộ trọng số ra công chúng—từ lâu đã tụt hậu so với các gã khổng lồ độc quyền về điểm số benchmark. Kimi K3 đã đảo ngược tình thế đó bằng cách kết hợp quy mô khổng lồ với một thiết kế giúp giữ chi phí trên mỗi truy vấn ở mức thấp. Các nhà phát triển cần một trợ lý lập trình hiệu suất cao mà không muốn phải trả hóa đơn đám mây đắt đỏ giờ đây đã có một lựa chọn hợp túi tiền.

Cách thức hoạt động

Kimi K3 sử dụng kiến trúc Mixture-of-Experts (MoE) thưa (sparse). Mô hình chứa 896 "chuyên gia" (experts), nhưng chỉ có 16 chuyên gia được kích hoạt cho mỗi token được xử lý. Điều đó có nghĩa là chỉ khoảng 1,8% tổng số tham số chạy trong bất kỳ yêu cầu nào. Việc kích hoạt thưa (sparse activation) giúp giảm nhu cầu tính toán và cắt giảm mạnh chi phí suy luận (inference costs) so với một mô hình dày đặc (dense model) có cùng kích thước.

Hiệu suất Benchmark

  • Frontend Code Arena – Kimi K3 dẫn đầu với số điểm Elo là 1.679, vượt qua các mô hình tốt tiếp theo.
  • SWE-bench Verified – Mô hình đạt 76,8%, theo sau Claude Opus 4.8 (88,6%) và GPT-5.5 (88,7%). Benchmark này tập trung vào việc sửa lỗi sâu trong một kho lưu trữ duy nhất (single-repo), nơi Kimi K3 không phải là đối thủ mạnh nhất.
  • Coding Index – Kimi K3 đạt 57 điểm, cao hơn đáng kể so với mức 44 của DeepSeek V4 Pro.

Ai sẽ được hưởng lợi

Nếu công việc của bạn xoay quanh các thành phần UI, khung ứng dụng web (web-app scaffolding), hoặc xây dựng các agent tạo mã lặp đi lặp lại, Kimi K3 mang lại một sự kết hợp hấp dẫn giữa sức mạnh và giá cả. Mô hình này vượt trội ở các câu lệnh (prompt) tạo ra nhiều đoạn mã nhỏ, xử lý các đặc tính riêng biệt của CSS/HTML/JavaScript và duy trì trạng thái qua một chuỗi các lệnh gọi.

Các doanh nghiệp cần cấp phép thương mại cũng có thể sử dụng giấy phép MIT đã được sửa đổi đi kèm với các trọng số được phát hành. Vì các tệp trọng số đầy đủ sẽ có mặt trên Hugging Face vào ngày 27 tháng 7 năm 2026, các đội ngũ có thể tích hợp mô hình vào quy trình của họ mà không cần chờ đợi một lớp bao (wrapper) dành riêng cho nhà cung cấp.

Giá cả và triển khai

  • Sử dụng API – 3 USD cho mỗi triệu token đầu vào, 15 USD cho mỗi triệu token đầu ra.
  • Cache hits – Khi cùng một chuỗi token được tái sử dụng, chi phí giảm xuống còn 0,30 USD cho mỗi triệu token.
  • Tự lưu trữ (Self-hosting) – Moonshot khuyên không nên chạy Kimi K3 trên các máy tính để bàn thông thường. Việc triển khai cục bộ cần ít nhất 64 bộ tăng tốc (accelerators) để có tính khả thi, khiến việc truy cập API đám mây trở thành điểm khởi đầu thực tế cho hầu hết các nhà phát triển.

Mức giá này giúp mô hình giữ được khả năng cạnh tranh so với các lựa chọn thay thế đóng vốn thường tính phí trên mỗi token cao hơn, đặc biệt là đối với các khối lượng công việc nặng về đầu ra.

Điều cần theo dõi

Việc phát hành Kimi K3 đã thu hẹp khoảng cách giữa các mô hình lập trình mở và đóng, nhưng cuộc cạnh tranh vẫn còn lâu mới ngã ngũ.

Điểm mấu chốt: Kimi K3 của Moonshot chứng minh rằng một mô hình trọng số mở, kích hoạt thưa có thể đánh bại các hệ thống đóng nổi tiếng nhất ngành trong các tác vụ lập trình khối lượng lớn và cụ thể—mang đến cho các nhà phát triển một công cụ mạnh mẽ, rẻ hơn cho lập trình frontend và lập trình dạng agent (agentic coding), mặc dù vẫn còn tụt hậu trong các thách thức sửa lỗi sâu.