Kimi K3, mô hình trọng số mở mới nhất từ đội ngũ Kimi, đi kèm với kiến trúc nền tảng mixture-of-experts (MoE) 2,8 nghìn tỷ tham số và cửa sổ ngữ cảnh 1 triệu token, ngay lập tức mở rộng những gì các nhà phát triển có thể chạy cục bộ mà không bị ràng buộc bởi các API đóng.

Thiết kế MoE giới hạn số lượng tham số hoạt động ở mức 104 tỷ, mang lại sức mạnh suy luận của một mô hình đa nghìn tỷ tham số trong khi vẫn duy trì tốc độ ổn định. Hiệu suất này mang lại mức tăng 2,5 lần so với bản phát hành Kimi K2 trước đó—một bước nhảy vọt cho bất kỳ ai từng gặp phải giới hạn về tính toán hoặc độ trễ trên các mô hình mở hiện có.

Tại sao bản nâng cấp này lại quan trọng vào lúc này

Các mô hình trọng số mở theo truyền thống thường tụt hậu so với các hệ thống độc quyền về quy mô và độ dài ngữ cảnh. Kimi K3 đã thay đổi cục diện bằng cách kết hợp quy mô khổng lồ với cửa sổ ngữ cảnh chứa được trọn vẹn một triệu token—đủ để nạp toàn bộ một kho lưu trữ mã nguồn hoặc một bài nghiên cứu dài chỉ trong một lần xử lý. Đối với các nhà phát triển đang xây dựng các đường ống tạo phản hồi tăng cường tra cứu (RAG), các trợ lý văn bản dài, hoặc các công cụ gỡ lỗi tự động, ngữ cảnh bổ sung này giúp giảm bớt nhu cầu về các chiến lược chia nhỏ dữ liệu (chunking).

Cơ sở kỹ thuật

  • Định tuyến Stable LatentMoE: Các token được phân phối qua 896 chuyên gia, với 16 chuyên gia được kích hoạt cho mỗi token. Sự kích hoạt thưa thớt này giúp giảm thiểu dấu chân bộ nhớ trong khi vẫn tận dụng được kho kiến thức khổng lồ.
  • Kimi Delta Attention (KDA): Một biến thể attention mới giúp ổn định luồng thông tin trong các mạng sâu, giảm thiểu rủi ro mất ổn định gradient vốn thường gặp ở các mô hình rất lớn.
  • Huấn luyện song song chuyên gia (Expert-parallel training): Đội ngũ đã sắp xếp tính toán sao cho mỗi chuyên gia chạy trên một phần phần cứng riêng biệt, ngăn chặn tình trạng nghẽn cổ chai xảy ra khi nhiều chuyên gia cùng tranh giành tài nguyên.
  • Quản lý bộ nhớ nâng cao: Các chiến lược phân bổ tùy chỉnh cho phép mô hình hỗ trợ huấn luyện tác nhân dựa trên học tăng cường mà không làm cạn kiệt bộ nhớ GPU.

Trọng số mở mang lại điều gì

Vì các trọng số được công khai, người dùng có thể kiểm chứng các biểu diễn nội bộ của mô hình, phát hiện các định kiến hoặc tinh chỉnh nó cho các lĩnh vực chuyên biệt. Việc tinh chỉnh (fine-tuning) trên dữ liệu độc quyền không còn yêu cầu hợp đồng đám mây; toàn bộ quy trình có thể chạy trên phần cứng tại chỗ (on-prem) đáp ứng các yêu cầu về huấn luyện song song chuyên gia của đội ngũ.

Các trường hợp sử dụng tức thì cho nhà phát triển

  • Các hệ thống tạo phản hồi tăng cường tra cứu (RAG) có thể truy xuất từ các kho tài liệu khổng lồ chỉ trong một câu lệnh (prompt) duy nhất.
  • Các trợ lý lập trình văn bản dài có khả năng giữ toàn bộ ngữ cảnh dự án trong bộ nhớ.
  • Các công cụ phân tích mã nguồn trên toàn bộ kho lưu trữ có thể quét hàng triệu dòng mã mà không làm quá tải câu lệnh.
  • Các tác nhân gỡ lỗi tự động có thể duy trì toàn bộ vết thực thi (execution trace) trong khi suy luận về các phương án sửa lỗi.