Mô hình MiMo-V2-Flash mới của Xiaomi, một hệ thống mixture-of-experts (MoE) với 309 tỷ tham số, hiện đang đứng đầu bảng xếp hạng mã nguồn mở trên SWE-Bench với độ chính xác 73,4%, trong khi chỉ sử dụng chưa đến 1/50 lượng tài nguyên tính toán so với các mô hình tương đương. Kết quả này cho thấy hiệu suất đỉnh cao là hoàn toàn khả thi mà không cần đến mức tiêu thụ năng lượng khổng lồ vốn đã trở thành tiêu chuẩn trong nghiên cứu mô hình ngôn ngữ lớn.
Tại sao Xiaomi lại chuyển sang MoE
Kiến trúc MoE giúp giảm thiểu chi phí bằng cách gắn nhiều mạng con "chuyên gia" (expert) vào một khung xương (backbone) dùng chung. Mô hình lưu trữ toàn bộ 309 tỷ tham số nhưng chỉ kích hoạt khoảng 15 tỷ tham số cho mỗi token. Việc kích hoạt có chọn lọc này giúp cắt giảm mạnh bộ nhớ và tài nguyên tính toán khi suy luận, cho phép mô hình chạy trên khoảng mười GPU H100 với 618 GB VRAM ở chế độ FP16.
Những thủ thuật kỹ thuật giúp mô hình trở nên thực tế
- Mô hình attention hỗn hợp (Hybrid attention pattern) – Hầu hết các lớp sử dụng sliding-window attention (attention cửa sổ trượt), giới hạn ma trận attention trong một dải hẹp xung quanh mỗi token. Cứ mỗi lớp thứ sáu sẽ chuyển sang global attention (attention toàn cục), giúp nắm bắt các phụ thuộc tầm xa mà không làm bùng nổ bộ nhớ. Mô hình này giúp giảm mức sử dụng bộ nhớ xuống gấp sáu lần.
- Module giải mã nhanh (Fast decoding module) – Một bộ dự đoán tích hợp có thể tạo ra nhiều token chỉ trong một lượt truyền thẳng (forward pass), mang lại tốc độ tạo văn bản nhanh hơn tới 2,6 lần so với phương pháp giải mã tự hồi quy (autoregressive decoding) tiêu chuẩn.
- Cửa sổ ngữ cảnh 256K – Kiến trúc này có khả năng tiếp nhận đầu vào lên tới một phần tư triệu token, rất hữu ích cho các kho mã nguồn, bài báo nghiên cứu hoặc bất kỳ tài liệu dài nào.
Những thành phần này giúp mô hình có thể sử dụng được trên các phần cứng mà nếu không có chúng, một hệ thống quy mô 309 tỷ tham số sẽ không thể tiếp cận được.
Multi-Teacher On-Policy Distillation (MOPD)
MOPD huấn luyện mô hình học sinh—MiMo-V2-Flash—bằng cách sử dụng nhiều mô hình giáo viên chuyên biệt: một cho toán học, một cho lập trình, v.v. Trong khi mô hình học sinh tự tạo ra các phản hồi của riêng mình, nó đồng thời nhận được phản hồi từ tất cả các giáo viên cùng một lúc. Vì mô hình học sinh học từ chính phân phối mà nó sẽ thực sự tạo ra, quá trình chưng cất (distillation) duy trì được sự ổn định và việc chuyển giao kiến thức luôn tập trung vào các tác vụ thực tế.
MOPD tiêu thụ chưa đến 1/50 lượng tài nguyên tính toán so với các phương pháp truyền thống.
Hiệu suất benchmark
| Benchmark | Điểm số |
|---|---|
| SWE-Bench (lập trình) | 73,4% |
| GPQA-Diamond (hỏi đáp tổng quát) | 83,7% |
| MMLU-Pro (hiểu ngôn ngữ đa tác vụ) | 84,9% |
| Arena-Hard (chat đối kháng) | 86,2% |
Những đánh đổi còn tồn tại
Ngay cả với những lợi ích tiết kiệm từ MoE, việc chạy MiMo-V2-Flash không phải là một bài toán có thể thực hiện trên laptop. Việc triển khai vẫn cần khoảng mười GPU H100, và yêu cầu 618 GB VRAM giới hạn mô hình trong các môi trường trung tâm dữ liệu có kết nối tốc độ cao.
Điều cần theo dõi tiếp theo
Điểm mấu chốt: MiMo-V2-Flash chứng minh rằng các quy trình huấn luyện thông minh và kiến trúc mô-đun có thể mang lại hiệu suất hàng đầu mà không cần đến chi phí tính toán leo thang vốn đã định hình sự phát triển của các mô hình ngôn ngữ lớn trong nhiều năm qua. Thách thức tiếp theo là làm sao để mức hiệu suất đó trở nên đủ rẻ cho bất kỳ ai, thay vì chỉ dành cho các phòng thí nghiệm được tài trợ dồi dào.
