Prism ML telah melancarkan Bonsai 27B, sebuah versi model bahasa besar Qwen 3.6 yang boleh dimuatkan ke dalam telefon bimbit. Dengan mengecilkan saiz asal 54 GB kepada kurang daripada 4 GB melalui kuantisasi 1-bit, syarikat tersebut berjaya mengurangkan saiz sebanyak 14 kali ganda dan membolehkan pengguna menjalankan model tersebut secara tempatan, tanpa panggilan API awan.
Mengapa pemampatan ini penting
LLM biasanya memerlukan GPU kelas desktop atau API berbayar kerana pemberatnya memakan ruang berpuluh-puluh gigabait. Kuantisasi—penggunaan bit yang lebih sedikit bagi setiap pemberat—mengecilkan model tetapi juga boleh menghapuskan pengetahuan. Bonsai menawarkan dua ekstrem: varian ternari (tiga nilai pemberat yang mungkin, 7.2 GB) dan varian 1-bit yang agresif (3.9 GB). Pertukaran antara saiz dan keupayaan menjadi asas kepada ujian ini.
Prestasi model dalam ingatan fakta
Qwen 3.6 yang asal menjawab setiap soalan tarikh sejarah dengan betul dalam set ujian penguji. Bonsai ternari tersalah lima daripada enam soalan, manakala versi 1-bit gagal dalam setiap pertanyaan tarikh. Seperti yang dijangkakan, pemampatan yang agresif akan membuang fakta khusus yang jarang ditemui terlebih dahulu, dan hanya mengekalkan corak bahasa luas yang memacu kelancaran.
Prestasi pengekodan menunjukkan hasil yang berbeza
Apabila arahan beralih kepada tugasan pengekodan, keputusannya berubah sepenuhnya. Ketiga-tiga model menyelesaikan pepijat konkurensi klasik tanpa ralat. Dalam cabaran animasi React yang mencabar, Bonsai 1-bit selesai dalam dua percubaan, manakala versi asal memerlukan empat percubaan kerana ia menghabiskan masa tambahan untuk menghuraikan kod tersebut. Versi ternari pula memerlukan sepuluh percubaan dan akhirnya menyebabkan pelayan ujian tergendala.
Cabaran praktikal
Bonsai tidak berjalan pada runtime Ollama yang popular. Model 1-bit memerlukan lapisan pelaksanaan tersuai yang dibekalkan oleh Prism ML, jadi pengguna mesti memasang perisian bukan standard untuk mengendalikannya. Kebergantungan ini mengehadkan daya tarikan model tersebut kepada mereka yang selesa mengubah suai persekitaran mereka.
Siapa yang patut mempertimbangkan Bonsai, dan siapa yang patut menjauhinya
- Sembang tujuan umum – Kehilangan butiran fakta yang drastik menjadikan Bonsai tidak sesuai sebagai pembantu pangkalan pengetahuan. Untuk jawapan tepat mengenai sejarah, sains, atau peristiwa semasa, kekal dengan model asal atau API awan.
- Pembantu pengekodan tempatan – Pembangun yang mahukan alat luar talian yang boleh mencadangkan kod, mengesan pepijat, dan berjalan pada telefon atau komputer riba spesifikasi rendah akan mendapati versi 1-bit memberikan kelajuan dan kos storan yang rendah. Ia bukanlah ejen autonomi, tetapi ia mengendalikan logik dan sintaks dengan cekap.
Kesimpulan
Bonsai 27B menunjukkan bahawa anda boleh memampatkan LLM 54 GB kepada 3.9 GB yang mesra telefon dan masih mendapat cadangan kod yang pantas serta kompeten secara mengejutkan. Harganya adalah penghakisan hampir menyeluruh terhadap ingatan fakta khusus, jadi model ini lebih sesuai untuk kotak peralatan pembangun yang mengutamakan kelajuan luar talian berbanding pengetahuan ensiklopedik.
