Mô hình 1-bit Bonsai 27B mới của PrismML chỉ nặng 3,9 GB và chạy với tốc độ khoảng 11 token mỗi giây trên iPhone 17 Pro Max, minh chứng cho thấy một mô hình ngôn ngữ 27 tỷ tham số có thể tồn tại trên một chiếc điện thoại thông minh phổ thông. Tuyên bố này có ý nghĩa quan trọng vì nó mở rộng ranh giới của AI trên thiết bị (on-device AI), hứa hẹn mang lại các trợ lý ngoại tuyến mạnh mẽ hơn mà không cần gửi dữ liệu lên đám mây.
Tại sao việc giảm dung lượng lại quan trọng
Phiên bản Bonsai 27B với độ chính xác đầy đủ (full-precision) nặng 54,7 GB. Bằng cách lượng tử hóa (quantising) mô hình về dạng biểu diễn 1-bit, PrismML đã thu nhỏ nó xuống còn 3,9 GB—giảm dung lượng tới 14 lần. Sự nén này giúp mô hình về mặt kỹ thuật có thể lưu trữ được trên các dòng iPhone cao cấp, một ngưỡng mà trước đây vốn loại bỏ bất kỳ thứ gì vượt quá vài trăm megabyte.
Hiệu suất của mô hình trên phần cứng Apple
PrismML đã xây dựng mô hình này cho MLX stack của Apple, một bộ API cho phép các nhà phát triển chạy mạng thần kinh (neural nets) trực tiếp trên neural engine. Trong các thử nghiệm riêng, mô hình đã tạo ra khoảng 11 token mỗi giây trên iPhone 17 Pro Max. Qua 15 bài kiểm tra chuẩn (benchmarks) cho mô hình ngôn ngữ, phiên bản 1-bit vẫn giữ được 89,5% điểm chất lượng của mô hình gốc, cho thấy việc nén không làm ảnh hưởng nghiêm trọng đến tính hữu dụng của nó.
Những giới hạn thực tế bạn sẽ gặp phải
- Áp lực bộ nhớ – Tệp 3,9 GB có thể vừa vặn, nhưng mô hình cũng cần một bộ nhớ đệm key-value (KV cache) để lưu trữ ngữ cảnh gần đây. Bộ nhớ đệm đó sẽ tăng dần theo độ dài của cuộc hội thoại và có thể đẩy mức sử dụng RAM của điện thoại lên cao, tiềm ẩn nguy cơ làm giảm tốc độ.
- Nhiệt độ và pin – Việc chạy một mạng lưới 27 tỷ tham số sẽ gây áp lực lớn lên neural engine. Điện thoại có xu hướng nóng lên khi tải liên tục, và cơ chế quản lý nhiệt của Apple sẽ giảm hiệu suất (throttle) để bảo vệ phần cứng. PrismML vẫn chưa công bố các con số cụ thể về mức tiêu thụ pin, vì vậy chi phí thực tế đối với thói quen sử dụng cả ngày vẫn chưa được xác định.
- Tính đặc thù của thiết bị – Tuyên bố về hiệu suất này chỉ áp dụng cho iPhone 17 Pro Max mới nhất. Các dòng iPhone cũ hơn, các thiết bị iOS phân khúc thấp hơn hoặc điện thoại Android thiếu khả năng tương đương của neural engine và sẽ thấy tốc độ suy luận (inference) chậm hơn hoặc thậm chí không thể chứa được mô hình.
Ai sẽ được hưởng lợi, và ai có thể bị bỏ lại phía sau
Các nhà phát triển ứng dụng ưu tiên quyền riêng tư giờ đây có thể lưu trữ một mô hình ngôn ngữ lớn ngay trên thiết bị, giữ dữ liệu người dùng ở lại trên điện thoại. Điều này có thể mang lại các trợ lý giọng nói phản hồi nhanh hơn, dịch thuật ngoại tuyến hoặc tạo văn bản theo ngữ cảnh mà không cần đăng ký dịch vụ đám mây.
Các nhà sản xuất Android và người dùng điện thoại tầm trung sẽ bị bỏ lỡ. Mô hình này dựa trên stack độc quyền của Apple, vì vậy phương pháp nén tương tự sẽ không tự động hoạt động trên các hệ sinh thái khác.
Những gì cần được kiểm chứng thêm
Các con số của PrismML đến từ các bài kiểm tra nội bộ. Các kiểm thử viên độc lập cần xác minh tốc độ token mỗi giây trong các phiên làm việc kéo dài, đo lường mức tiêu thụ pin thực tế và đánh giá tốc độ suy giảm hiệu suất khi KV cache mở rộng. Việc sử dụng trong thế giới thực—như trò chuyện trong một giờ, phát trực tuyến nội dung hoặc chạy mô hình song song với các ứng dụng khác—sẽ cho thấy liệu con số 11 token mỗi giây có duy trì được ngoài môi trường phòng thí nghiệm được kiểm soát hay không.
Kết luận
Bonsai 27B cho thấy các mô hình ngôn ngữ 27 tỷ tham số có thể được nén đủ để chạy trên một chiếc iPhone cao cấp, mang lại chất lượng gần như nguyên bản với tốc độ vừa phải. Bước đột phá này phụ thuộc vào MLX stack của Apple và vẫn phải đối mặt với những rào cản thực tế: mức tiêu tốn bộ nhớ, việc giảm hiệu suất do nhiệt và tác động chưa rõ ràng đến pin. Nếu các thử nghiệm tiếp theo xác nhận những tuyên bố này, AI trên thiết bị có thể chuyển từ các bản demo ngách sang các ứng dụng hàng ngày—với điều kiện khoảng cách phần cứng giữa các dòng iPhone cao cấp và phần còn lại của thị trường được thu hẹp.
