Prism ML đã ra mắt Bonsai 27B, một phiên bản của mô hình ngôn ngữ lớn Qwen 3.6 có thể chạy được trên điện thoại di động. Bằng cách nén bản gốc 54 GB xuống còn dưới 4 GB thông qua kỹ thuật lượng tử hóa 1-bit (1-bit quantization), công ty đã đạt được mức giảm kích thước gấp 14 lần và cho phép người dùng chạy mô hình cục bộ mà không cần gọi API đám mây.

Tại sao việc nén lại quan trọng

Các LLM thường yêu cầu GPU cấp độ máy tính để bàn hoặc API trả phí vì các trọng số (weights) của chúng chiếm tới hàng chục gigabyte. Lượng tử hóa (Quantization)—sử dụng ít bit hơn cho mỗi trọng số—giúp thu nhỏ mô hình nhưng cũng có thể làm mất đi kiến thức. Bonsai cung cấp hai thái cực: một biến thể ternary (ba giá trị trọng số có thể có, 7,2 GB) và một biến thể 1-bit mạnh mẽ (3,9 GB). Sự đánh đổi giữa kích thước và khả năng chính là trọng tâm của bài kiểm tra này.

Hiệu suất của các mô hình trong việc truy xuất dữ kiện

Mô hình Qwen 3.6 gốc đã trả lời chính xác mọi câu hỏi về ngày tháng lịch sử trong bộ thử nghiệm. Phiên bản Bonsai ternary đã trả lời sai 5 trên 6 câu, và phiên bản 1-bit thất bại ở mọi truy vấn về ngày tháng. Đúng như dự đoán, việc nén mạnh mẽ sẽ loại bỏ các dữ kiện cụ thể và hiếm gặp trước tiên, chỉ giữ lại các mẫu ngôn ngữ rộng giúp duy trì sự trôi chảy.

Hiệu suất lập trình lại cho thấy một câu chuyện khác

Khi các câu lệnh (prompts) chuyển sang các tác vụ lập trình, kết quả đã đảo ngược hoàn toàn. Cả ba mô hình đều giải quyết các lỗi đồng thời (concurrency bugs) kinh điển mà không gặp sai sót nào. Trong một thử thách về hoạt ảnh React đầy khó nhằn, Bonsai 1-bit hoàn thành chỉ sau hai lần thử, trong khi bản gốc cần bốn lần vì mất thêm thời gian để phân tích mã nguồn. Phiên bản ternary cần tới mười lần thử và cuối cùng đã làm sập máy chủ thử nghiệm.

Những rào cản thực tế

Bonsai không chạy trên môi trường thực thi Ollama phổ biến. Mô hình 1-bit cần một lớp thực thi tùy chỉnh do Prism ML cung cấp, vì vậy người dùng phải cài đặt phần mềm không tiêu chuẩn để có thể sử dụng. Sự phụ thuộc này làm hạn chế sức hấp dẫn của mô hình đối với những người không quen với việc tinh chỉnh môi trường hệ thống.

Ai nên cân nhắc Bonsai, và ai nên tránh xa

  • Chat đa dụng – Việc mất mát nghiêm trọng các chi tiết thực tế khiến Bonsai không phù hợp để làm trợ lý cơ sở kiến thức. Để có câu trả lời chính xác về lịch sử, khoa học hoặc các sự kiện hiện tại, hãy trung thành với mô hình gốc hoặc API đám mây.
  • Trợ lý lập trình cục bộ – Các nhà phát triển muốn một công cụ ngoại tuyến có thể gợi ý mã, phát hiện lỗi và chạy trên điện thoại hoặc laptop cấu hình thấp sẽ thấy phiên bản 1-bit mang lại tốc độ và chi phí lưu trữ thấp. Nó không phải là một tác nhân tự trị (autonomous agent), nhưng nó xử lý logic và cú pháp một cách hiệu quả.

Kết luận

Bonsai 27B cho thấy bạn có thể nén một LLM 54 GB xuống còn 3,9 GB thân thiện với điện thoại mà vẫn nhận được các gợi ý mã nhanh chóng và thành thạo một cách đáng ngạc nhiên. Cái giá phải trả là sự xói mòn gần như hoàn toàn khả năng truy xuất dữ kiện cụ thể, vì vậy mô hình này thuộc về bộ công cụ của những nhà phát triển coi trọng tốc độ ngoại tuyến hơn là kiến thức bách khoa toàn thư.