Prism ML meluncurkan Bonsai 27B, sebuah versi dari model bahasa besar Qwen 3.6 yang dapat berjalan di ponsel. Dengan memampatkan versi asli 54 GB menjadi kurang dari 4 GB menggunakan kuantisasi 1-bit, perusahaan ini memberikan pengurangan ukuran sebesar 14× dan memungkinkan pengguna menjalankan model secara lokal, tanpa panggilan API cloud.
Mengapa kompresi ini penting
LLM biasanya membutuhkan GPU kelas desktop atau API berbayar karena bobotnya memakan puluhan gigabita. Kuantisasi—menggunakan lebih sedikit bit per bobot—memperkecil model tetapi juga dapat menghilangkan pengetahuan. Bonsai menawarkan dua ekstrem: varian ternari (tiga nilai bobot yang memungkinkan, 7,2 GB) dan varian 1-bit yang agresif (3,9 GB). Pertukaran antara ukuran dan kemampuan menjadi dasar pengujian ini.
Bagaimana performa model dalam mengingat fakta
Qwen 3.6 asli menjawab setiap pertanyaan tanggal sejarah dengan benar dalam rangkaian pengujian. Bonsai ternari salah menjawab lima dari enam pertanyaan, dan versi 1-bit gagal menjawab setiap kueri tanggal. Seperti yang diperkirakan, kompresi yang agresif membuang fakta-fakta spesifik yang langka terlebih dahulu, dan hanya mempertahankan pola bahasa luas yang mendorong kelancaran.
Performa coding menceritakan hal yang berbeda
Ketika perintah beralih ke tugas coding, hasilnya berbalik. Ketiga model tersebut menyelesaikan bug konkurensi klasik tanpa kesalahan. Pada tantangan animasi React yang menuntut, Bonsai 1-bit selesai dalam dua percobaan, sementara versi aslinya membutuhkan empat kali percobaan karena menghabiskan waktu ekstra untuk mengurai kode. Versi ternari membutuhkan sepuluh kali percobaan dan akhirnya membuat server pengujian crash.
Hambatan praktis
Bonsai tidak berjalan pada runtime Ollama yang populer. Model 1-bit memerlukan lapisan eksekusi khusus yang disediakan oleh Prism ML, sehingga pengguna harus menginstal perangkat lunak non-standar agar dapat berfungsi. Ketergantungan ini membatasi daya tarik model bagi mereka yang terbiasa mengutak-atik lingkungan mereka.
Siapa yang harus mempertimbangkan Bonsai, dan siapa yang harus menghindarinya
- Chat serbaguna – Hilangnya detail faktual secara drastis membuat Bonsai tidak cocok sebagai asisten basis pengetahuan. Untuk jawaban akurat mengenai sejarah, sains, atau peristiwa terkini, tetaplah gunakan model asli atau API cloud.
- Asisten coding lokal – Pengembang yang menginginkan alat offline yang dapat menyarankan kode, menangkap bug, dan berjalan di ponsel atau laptop spesifikasi rendah akan mendapati bahwa versi 1-bit memberikan kecepatan dan biaya penyimpanan yang rendah. Ini bukan agen otonom, tetapi ia menangani logika dan sintaksis secara efisien.
Kesimpulan
Bonsai 27B menunjukkan bahwa Anda dapat mengompresi LLM 54 GB menjadi 3,9 GB yang ramah ponsel dan tetap mendapatkan saran kode yang sangat cepat dan kompeten. Harganya adalah pengikisan hampir total pada ingatan faktual yang spesifik, sehingga model ini lebih cocok untuk kotak peralatan pengembang yang lebih menghargai kecepatan offline daripada pengetahuan ensiklopedis.
