POCKET-35B, sebuah model bahasa dengan 35 miliar parameter yang dirilis oleh VIDRAFT, kini dapat dijalankan pada laptop yang hanya memiliki CPU. Bobot (weights) berformat GGUF dari model ini dapat dimuat langsung ke dalam llama.cpp atau Ollama, sehingga tim dengan anggaran GPU nol dapat segera mulai bereksperimen. Dalam tujuh minggu sejak peluncurannya, model ini telah melampaui satu juta unduhan di Hugging Face, menempati peringkat ke-13 di antara semua unduhan GGUF di seluruh dunia.
Mengapa LLM berbasis CPU saja menjadi penting saat ini
Perusahaan yang perlu menyimpan teks milik sendiri—email pelanggan, tiket internal, cuplikan kode—secara on-premises sering kali kekurangan dana untuk kartu grafis khusus. Hingga baru-baru ini, satu-satunya pilihan praktis adalah mengirimkan data ke API yang dihosting di cloud, yang mengorbankan privasi dan menimbulkan biaya berulang. POCKET-35B menjanjikan jalan tengah: sebuah model yang cukup besar untuk menangani prompt kompleks namun tetap muat dalam batas memori laptop kantor atau mini-PC pada umumnya.
Bagaimana model ini dapat berjalan di laptop
- Format GGUF – sebuah kontainer biner yang menyimpan bobot terkuantisasi (quantized weights).
- Kompatibilitas – baik llama.cpp maupun Ollama menyertakan runtime yang dapat membaca file GGUF dan menjalankan inferensi pada CPU. GPU terintegrasi dapat digunakan untuk mengalihkan (offload) beberapa lapisan, tetapi hal ini tidak wajib.
- Pengecekan RAM – ukuran file GGUF adalah jumlah RAM minimum yang Anda butuhkan. Jika ukuran filenya, misalnya, beberapa gigabyte, maka mesin dengan memori bebas setidaknya sebanyak itu diperlukan bahkan sebelum pengunduhan dimulai.
Langkah-langkah menjalankan POCKET-35B di laptop Anda
- Verifikasi memori – buka task manager sistem Anda, catat total RAM, dan bandingkan dengan ukuran file GGUF yang tertera di halaman Hugging Face.
- Pilih kuantisasi yang tepat – mulailah dengan versi Q4; versi ini menyeimbangkan ukuran dan kecepatan untuk sebagian besar laptop.
- Unduh melalui llama.cpp atau Ollama – kedua alat ini dapat mengambil model secara langsung dari Hugging Face, serta menangani verifikasi checksum secara otomatis.
- Lakukan uji coba cepat (sanity check) – jalankan runtime dengan prompt sederhana “Hello, world” untuk memastikan pemuatan berhasil.
- Buat rangkaian benchmark yang realistis – kumpulkan 30-50 tugas yang mencerminkan beban kerja produksi Anda (misalnya, mengklasifikasikan kategori tiket, menyusun draf balasan email). Jalankan tugas-tugas tersebut melalui model dan catat latensi serta kualitas output token.
- Uji cakupan bahasa – dokumentasi POCKET-35B tidak menyertakan daftar bahasa. Jika Anda memerlukan bahasa Vietnam atau skrip non-Inggris lainnya, masukkan beberapa kalimat beraksen dan amati apakah model menghasilkan output yang koheren.
- Ukur latensi sebenarnya – catat waktu per-prompt pada perangkat keras spesifik Anda; jangan mengandalkan angka benchmark yang diposting oleh pengguna lain dengan CPU atau bandwidth RAM yang berbeda.
Apa yang tidak diberitahukan oleh angka unduhan
Satu juta unduhan menandakan rasa ingin tahu komunitas yang kuat, bukan jaminan performa. Kemampuan penalaran, keterampilan pembuatan kode, dan kepatuhan instruksi model ini belum diaudit secara independen. VIDRAFT belum mengungkapkan detail arsitektur model atau sumber data pelatihannya, sehingga menyisakan celah informasi yang membuat penerapan di lingkungan produksi menjadi berisiko.
Risiko dan argumen penyeimbang
- Kualitas yang tidak jelas – tanpa metrik evaluasi yang dipublikasikan, Anda tidak dapat memastikan apakah POCKET-35B menyamai akurasi alternatif sumber terbuka (open-source) lainnya.
- Ketidakpastian tingkat produksi – kurangnya transparansi arsitektur membuatnya lebih sulit untuk memprediksi perilaku di bawah prompt adversarial atau input kasus ekstrem (edge-case).
Kesimpulan
Jika tim Anda perlu bereksperimen dengan LLM berparameter 35B hari ini dan tidak mampu membeli GPU, POCKET-35B menawarkan titik masuk yang layak dan berbiaya rendah. Model ini berjalan di laptop standar menggunakan format GGUF, dan runtime sumber terbuka membuatnya mudah untuk disiapkan. Namun, perlakukan model ini sebagai eksperimental: verifikasi persyaratan memori, lakukan benchmark dengan tugas nyata, dan konfirmasi penanganan bahasa sebelum mengintegrasikannya ke dalam pipeline produksi apa pun. Seiring terkumpulnya data komunitas dan rilisnya detail lebih lanjut dari VIDRAFT, profil risiko akan menjadi lebih jelas—tetapi untuk saat ini, sebuah laptop tunggal memang dapat menampung LLM 35B, meskipun dengan ekspektasi yang terukur.
