Một mô hình Mixture-of-Experts (MoE) với 150 tỷ tham số có thể tạo văn bản ngay trên một chiếc laptop lập trình viên tiêu chuẩn. Thí nghiệm cho thấy RAM, chứ không phải tốc độ SSD, mới là yếu tố giới hạn hiệu suất thực sự. Điều này quan trọng vì nó chứng minh rằng các mô hình quy mô tiên phong (frontier-scale) có thể được kiểm thử cục bộ mà không cần tốn chi phí cho điện toán đám mây.
Thử nghiệm
Chúng tôi đã chạy mô hình DeepSeek V4 Flash—một mô hình MoE 150 tỷ tham số đã được cắt tỉa bằng REAP—thông qua công cụ suy luận mã nguồn mở Colibrì. Phần cứng được sử dụng là một chiếc laptop AMD Ryzen AI 9 365 với 61 GB RAM và ổ cứng NVMe SSD 1 TB. Chúng tôi đã đo thời gian của một lượt tạo văn bản kéo dài ba phút và ghi lại mọi lượt truy cập đĩa.
Những con số tiết lộ điều gì
- Hoạt động của đĩa ở mức tối thiểu. SSD chỉ thực hiện chưa đầy 11 giây đọc dữ liệu trong suốt ba phút tạo văn bản. Ngay cả khi ổ cứng có thể đọc dữ liệu ngay lập tức, tổng thông lượng (throughput) cũng chỉ cải thiện khoảng 6%.
- Dung lượng RAM ảnh hưởng trực tiếp đến tốc độ. Việc giảm một nửa bộ nhớ đệm RAM đã làm giảm thông lượng khoảng 15%. CPU dành thời gian để xử lý các lỗi bộ nhớ đệm (cache misses)—như giải lượng tử hóa (de-quantising), sao chép và quản lý dữ liệu—gần bằng thời gian chờ đĩa.
Những con số này đã bác bỏ quan niệm phổ biến rằng băng thông lưu trữ là điểm nghẽn chính cho việc suy luận mô hình lớn trên laptop.
Tại sao RAM vượt trội hơn SSD
Khi một tham số mô hình chưa có sẵn trong RAM, hệ thống phải:
- Lấy dữ liệu từ SSD.
- Giải mã và chuyển nó vào các thanh ghi CPU để tính toán.
Cả hai bước đều tiêu tốn chu kỳ xử lý. Bước đầu tiên bị giới hạn bởi băng thông của SSD; bước thứ hai gây ra độ trễ tương đương vì CPU phải giải lượng tử hóa dữ liệu bất kể dữ liệu được truyền đến nhanh hay chậm. Do đó, một ổ SSD nhanh hơn sẽ mang lại hiệu quả giảm dần, trong khi nhiều RAM hơn sẽ giúp giữ được nhiều phần của mô hình trong bộ nhớ và loại bỏ quá trình truyền tải dữ liệu tốn kém này.
Ý nghĩa đối với các nhà phát triển
- Đầu tư vào bộ nhớ, không phải lưu trữ.
- Kiểm thử cục bộ trở nên khả thi. Các nhà phát triển có thể chạy các mô hình MoE trọng số mở (open-weight) trên các máy tính hiện có, kiểm tra phong cách, hành vi gọi công cụ (tool-calling) và chất lượng đầu ra mà không cần trả phí cho các dịch vụ đám mây.
- Đánh giá theo lô (batch evaluation) là điều thực tế. Trò chuyện thời gian thực có thể vẫn cảm thấy chậm chạp, nhưng các tác vụ xếp hàng—như tạo hàng chục câu lệnh (prompt) để nghiên cứu—có thể chạy mượt mà trên một chiếc laptop.
Lập luận phản bác tiềm năng
Một số người có thể cho rằng độ trễ của SSD vẫn quan trọng đối với các khối lượng công việc cần tải lặp đi lặp lại các trọng số chuyên gia (expert weights) mới.
Những điều cần theo dõi tiếp theo
- Các biến thể mô hình tiết kiệm bộ nhớ.
- Phần cứng với bộ nhớ đệm trên chip (on-chip cache) lớn hơn.
- Các chiến lược bộ nhớ đệm ở cấp độ phần mềm.
Kết luận rất rõ ràng: những nhà phát triển muốn thử nghiệm các mô hình MoE khổng lồ trên laptop nên mua thêm RAM. Việc nâng cấp SSD chỉ giúp giảm được vài phần trăm thời gian, trong khi thêm bộ nhớ có thể cắt giảm thời gian suy luận tới hàng chục phần trăm. Điều này thay đổi bài toán chi phí cho việc tạo mẫu AI (AI prototyping) và mở ra cánh cửa cho việc kiểm thử cục bộ, không tốn kém các mô hình mà trước đây vốn được cho là cần các cụm máy chủ đám mây chuyên dụng.
