POCKET-35B, sebuah model bahasa dengan 35 bilion parameter yang dikeluarkan oleh VIDRAFT, kini boleh dijalankan pada komputer riba yang hanya mempunyai CPU. Pemberat berformat GGUF model ini dimuatkan terus ke dalam llama.cpp atau Ollama, jadi pasukan yang tidak mempunyai bajet GPU boleh mula bereksperimen dengan segera. Dalam tempoh tujuh minggu selepas pelancarannya, model ini telah melepasi satu juta muat turun di Hugging Face, menduduki tempat ke-13 dalam kalangan semua muat turun GGUF di seluruh dunia.
Mengapa LLM khusus CPU penting sekarang
Perusahaan yang perlu menyimpan teks proprietari—emel pelanggan, tiket dalaman, petikan kod—secara atas premis (on-premises) sering kali kekurangan dana untuk kad grafik khusus. Sehingga baru-baru ini, satu-satunya pilihan praktikal adalah dengan menghantar data ke API yang dihoskan di awan, sekali gus mengorbankan privasi dan melibatkan kos berulang. POCKET-35B menjanjikan jalan tengah: sebuah model yang cukup besar untuk mengendalikan arahan (prompt) yang kompleks sambil memuatkan had memori komputer riba pejabat atau mini-PC biasa.
Bagaimana model ini muat pada komputer riba
- Format GGUF – bekas binari yang menyimpan pemberat terkuantisasi (quantized weights).
- Keserasian – kedua-dua llama.cpp dan Ollama menyertakan runtime yang membaca fail GGUF dan melaksanakan inferens pada CPU. GPU bersepadu boleh digunakan untuk mengalihkan (offload) beberapa lapisan, tetapi ia tidak diperlukan.
- Semakan RAM – saiz fail GGUF adalah jumlah minimum RAM yang anda perlukan. Jika saiz fail adalah, sebagai contoh, beberapa gigabait, mesin dengan sekurang-kurangnya jumlah memori bebas tersebut diperlukan sebelum muat turun bermula.
Langkah-langkah untuk menjalankan POCKET-35B pada komputer riba anda
- Sahkan memori – buka pengurus tugas (task manager) sistem anda, catat jumlah RAM, dan bandingkan dengan saiz fail GGUF yang disenaraikan pada halaman Hugging Face.
- Pilih kuantisasi yang betul – mulakan dengan versi Q4; ia mengimbangi saiz dan kelajuan untuk kebanyakan komputer riba.
- Muat turun melalui llama.cpp atau Ollama – kedua-dua alatan boleh mengambil model secara terus dari Hugging Face, dengan mengendalikan pengesahan checksum secara automatik.
- Jalankan semakan pantas – lancarkan runtime dengan arahan “Hello, world” yang ringkas untuk mengesahkan pemuatan berjaya.
- Cipta set penanda aras (benchmark) yang realistik – kumpulkan 30-50 tugasan yang mencerminkan beban kerja pengeluaran anda (contohnya, mengelaskan kategori tiket, merangka balasan emel). Jalankannya melalui model tersebut dan rekodkan kependaman (latency) serta kualiti output token.
- Uji liputan bahasa – dokumentasi POCKET-35B tidak menyertakan senarai bahasa. Jika anda memerlukan bahasa Vietnam atau skrip bukan bahasa Inggeris yang lain, masukkan beberapa ayat beraksen dan perhatikan sama ada model tersebut menghasilkan output yang koheren.
- Ukur kependaman sebenar – rekodkan masa bagi setiap arahan pada perkakasan khusus anda; jangan bergantung pada angka penanda aras yang dimuat naik oleh pengguna lain dengan CPU atau lebar jalur RAM yang berbeza.
Apa yang angka muat turun tidak beritahu anda
Satu juta muat turun menandakan rasa ingin tahu komuniti yang kuat, bukannya prestasi yang terjamin. Keupayaan penaakulan model, kemahiran penjanaan kod, dan pematuhan arahan belum diaudit secara bebas. VIDRAFT belum mendedahkan butiran seni bina model atau sumber data latihan, meninggalkan jurang maklumat yang menjadikan penggunaan pengeluaran (production deployment) berisiko.
Risiko dan hujah balas
- Kualiti tidak jelas – tanpa metrik penilaian yang diterbitkan, anda tidak boleh pasti sama ada POCKET-35B menyamai ketepatan alternatif sumber terbuka yang lain.
- Ketidakpastian gred pengeluaran – kekurangan ketelusan seni bina menyukarkan ramalan tingkah laku di bawah arahan adversarial atau input kes terpencil (edge-case).
Kesimpulan
Jika pasukan anda perlu bereksperimen dengan LLM 35 bilion parameter hari ini dan tidak mampu memiliki GPU, POCKET-35B menawarkan titik permulaan yang berdaya maju dan kos rendah. Model ini berjalan pada komputer riba standard menggunakan format GGUF, dan runtime sumber terbuka memudahkan penyediaan. Walau bagaimanapun, anggap model ini sebagai eksperimen: sahkan keperluan memori, buat penanda aras dengan tugasan sebenar, dan sahkan pengendalian bahasa sebelum menyepadukannya ke dalam mana-mana saluran pengeluaran (production pipeline). Apabila data komuniti terkumpul dan VIDRAFT mengeluarkan lebih banyak butiran, profil risiko akan menjadi lebih jelas—tetapi buat masa ini, sebuah komputer riba sahaja sememangnya boleh menghoskan LLM 35 B, walaupun dengan jangkaan yang terkawal.
