Microsoft mengumumkan rangka kerja BitNet sumber terbuka, sebuah alat yang membolehkan pembangun menjalankan model bahasa besar (LLM) 1-bit pada satu CPU sahaja dan mendakwa peningkatan kelajuan sehingga enam kali ganda berbanding kod inferens berasaskan CPU sedia ada.
Mengapa model 1-bit penting
Kebanyakan LLM moden menggunakan nombor titik apung (floating-point) 16- atau 32-bit, yang meningkatkan penggunaan memori dan penggunaan kuasa. BitNet menggantikan nilai tersebut dengan matematik “1.58-bit”, mengehadkan setiap pemberat (weight) kepada –1, 0, atau +1. Pengurangan ini mengecilkan saiz model secara drastik; rangkaian dengan 100 bilion parameter boleh dijalankan pada CPU kelas komputer riba. Pembangun mesti melatih model dari awal menggunakan seni bina BitNet; ia bukan sekadar penukaran mudah.
Peningkatan prestasi yang dilaporkan
- Throughput: 5–7 token sesaat pada satu teras CPU.
- Kelajuan vs. llama.cpp: 2.37×-6.17× lebih pantas pada pemproses x86.
- Penggunaan tenaga: Penggunaan kuasa sehingga 82.2% lebih rendah pada perkakasan yang sama.
- Memori: Keperluan RAM 16×-32× lebih rendah.
Model utama yang dikeluarkan bersama kod sumber tersebut, BitNet-b1.58-2B-4T, mengandungi 2.4 bilion parameter. Microsoft mengedarkan perisian ini di bawah lesen MIT yang permisif, menjemput sesiapa sahaja untuk membina, mengubah suai, atau mengedarkan semula model 1-bit mereka sendiri.
Kes penggunaan mengutamakan edge
Menjalankan inferens tanpa GPU membuka peluang bagi aplikasi luar talian atau aplikasi yang sensitif terhadap privasi. Peranti IoT kecil, dron yang dikerahkan di lapangan, dan komputer riba yang tidak mempunyai sambungan internet boleh menyematkan keupayaan bahasa secara tempatan. Penggunaan tenaga yang lebih rendah juga menarik minat perkakasan berkuasa bateri.
Apakah hadnya
Halangan terbesar ialah melatih model dari awal. Model sumber terbuka sedia ada seperti Llama tidak boleh sekadar “di-kuantisasi bit” (bit-quantized) ke dalam format BitNet; ia mesti dibina semula dengan skema pemberat tiga nilai.
Siapa yang mendapat manfaat, siapa yang kekal
- Syarikat pemula (start-ups) dan peminat hobi: Kos perkakasan yang lebih rendah boleh mempercepatkan eksperimen dan prototaip produk.
- Perusahaan dengan polisi kedaulatan data yang ketat: Inferens di premis (on-premise) mengelakkan penghantaran data kepada penyedia awan.
- Makmal AI berskala besar: Kemungkinan besar akan terus menggunakan GPU untuk latihan dan penyajian (serving) berkapasiti tinggi, di mana kelajuan mentah masih penting.
Apa yang perlu diperhatikan seterusnya
- Penerimaan komuniti: Bilangan model pihak ketiga yang dilatih dalam format BitNet akan menunjukkan kepantasan pertumbuhan ekosistem tersebut.
- Integrasi peralatan (tooling): Keserasian dengan saluran latihan (training pipelines) dan platform penggunaan yang popular boleh menjadikan rangka kerja ini lebih mudah dicapai.
- Penanda aras dunia nyata: Pengukuran bebas terhadap ketepatan, kependaman (latency), dan kuasa pada pelbagai perkakasan akan mendedahkan sama ada peningkatan yang didakwa kekal di luar makmal.
- Penyelidikan kuantisasi lanjut: Jika penyelidik dapat mengurangkan lebar bit dengan lebih rendah lagi tanpa mengorbankan kualiti, impian penggunaan CPU sahaja akan menjadi lebih realistik.
BitNet membuktikan bahawa menjalankan model bahasa yang besar pada pemproses harian adalah berdaya maju secara teknikal, tetapi ia tidak menghapuskan keperluan untuk GPU dalam senario berprestasi tinggi. Rangka kerja ini mungkin mendemokrasikan AI untuk kelompok pembangun yang lebih luas, manakala beban kerja pengkomputeran berat yang memacu penyelidikan canggih kemungkinan besar akan kekal berpusatkan GPU untuk masa depan yang boleh diramalkan.
