Model 1-bit Bonsai 27B baharu daripada PrismML muat dalam fail bersaiz 3.9 GB dan berjalan pada kadar kira-kira 11 token sesaat pada iPhone 17 Pro Max, membuktikan bahawa model bahasa dengan 27 bilion parameter boleh berfungsi pada telefon pintar pengguna. Dakwaan ini penting kerana ia meluaskan sempadan AI pada peranti, menjanjikan pembantu luar talian yang lebih kaya tanpa perlu menghantar data ke awan.
Mengapa pengurangan ini penting
Bonsai 27B dengan ketepatan penuh (full-precision) berukuran 54.7 GB. Dengan melakukan kuantisasi (quantising) model tersebut kepada representasi bit tunggal, PrismML mengecilkannya kepada 3.9 GB—pengurangan saiz sebanyak 14 kali ganda. Pemampatan tersebut menjadikan model ini secara teknikalnya boleh disimpan pada iPhone kelas atasan, satu ambang yang sebelum ini mengecualikan apa sahaja yang melebihi beberapa ratus megabait.
Prestasi model pada perkakasan Apple
PrismML membina model ini untuk stack MLX Apple, iaitu set API yang membolehkan pembangun menjalankan rangkaian neural (neural nets) secara terus pada neural engine. Dalam ujiannya sendiri, model tersebut menjana kira-kira 11 token setiap saat pada iPhone 17 Pro Max. Merentasi 15 penanda aras (benchmark) model bahasa standard, versi 1-bit mengekalkan 89.5% skor kualiti model asal, menunjukkan bahawa pemampatan tersebut tidak menjejaskan kegunaannya secara drastik.
Had praktikal yang akan anda hadapi
- Tekanan memori – Fail 3.9 GB tersebut muat, tetapi model itu juga memerlukan cache kunci-nilai (KV cache) untuk menyimpan konteks terkini. Cache tersebut akan berkembang mengikut panjang perbualan dan boleh meningkatkan penggunaan RAM telefon, yang berpotensi memperlahankan kelajuan.
- Haba dan bateri – Menjalankan rangkaian 27 bilion parameter membebankan neural engine. Telefon cenderung menjadi panas di bawah beban berterusan, dan pengurusan terma Apple akan mengehadkan (throttle) prestasi untuk melindungi perkakasan. PrismML belum mengeluarkan angka penggunaan bateri yang konkrit, jadi kesan sebenar terhadap corak penggunaan harian masih belum diketahui.
- Spesifikasi peranti – Dakwaan prestasi ini terpakai untuk iPhone 17 Pro Max yang terkini. iPhone lama, peranti iOS kelas bawahan, atau telefon Android tidak mempunyai keupayaan neural engine yang sama dan akan mengalami inferens yang lebih perlahan atau mungkin tidak dapat memuatkan model tersebut sama sekali.
Siapa yang akan mendapat manfaat, dan siapa yang mungkin ketinggalan
Pembangun aplikasi yang mengutamakan privasi kini boleh menghoskan model bahasa besar secara terus pada peranti, sekali gus mengekalkan data pengguna di dalam telefon. Ini boleh bermaksud pembantu suara yang lebih responsif, terjemahan luar talian, atau penjanaan teks kontekstual tanpa langganan awan.
Pengeluar Android dan pengguna telefon kelas pertengahan akan ketinggalan. Model ini bergantung pada stack proprietari Apple, jadi pemampatan yang sama tidak akan berfungsi secara automatik pada ekosistem lain.
Apa yang masih perlu diuji
Angka daripada PrismML adalah berdasarkan penanda aras dalaman. Penguji bebas perlu mengesahkan kadar token sesaat bagi sesi yang panjang, mengukur penggunaan bateri sebenar, dan menilai seberapa cepat prestasi merosot apabila KV cache berkembang. Penggunaan dunia nyata—seperti berbual selama sejam, penstriman kandungan, atau menjalankan model bersama aplikasi lain—akan mendedahkan sama ada angka 11 token sesaat itu kekal stabil di luar makmal yang terkawal.
Kesimpulan
Bonsai 27B menunjukkan bahawa model bahasa 27 bilion parameter boleh dimampatkan secukupnya untuk berfungsi pada iPhone flagship, memberikan kualiti hampir penuh pada kelajuan yang sederhana. Kejayaan ini bergantung pada stack MLX Apple dan masih menghadapi rintangan praktikal: beban memori, pengehadan terma (thermal throttling), dan kesan bateri yang tidak diketahui. Jika ujian susulan mengesahkan dakwaan tersebut, AI pada peranti boleh beralih daripada demo khusus kepada aplikasi harian—dengan syarat jurang perkakasan antara peranti flagship iOS dan pasaran lain semakin mengecil.
