Model Mixture-of-Experts dengan 150 miliar parameter dapat menghasilkan teks pada laptop pengembang standar. Eksperimen ini menunjukkan bahwa RAM, bukan kecepatan SSD, adalah pembatas performa yang sebenarnya. Hal ini penting karena membuktikan bahwa model skala mutakhir dapat diuji secara lokal tanpa harus mengeluarkan biaya untuk komputasi cloud.
Pengujian
Kami menjalankan model DeepSeek V4 Flash—sebuah MoE 150 B-parameter yang telah dipangkas dengan REAP—melalui mesin inferensi open-source Colibrì. Perangkat keras yang digunakan adalah laptop AMD Ryzen AI 9 365 dengan RAM 61 GB dan SSD NVMe 1 TB. Kami mengukur durasi proses pembuatan teks selama tiga menit dan mencatat setiap akses disk.
Apa yang Diungkapkan oleh Angka-angka Tersebut
- Aktivitas disk sangat minimal. SSD melakukan pembacaan kurang dari 11 detik selama proses pembuatan teks tiga menit tersebut. Bahkan jika drive dapat membaca data secara instan, total throughput hanya akan meningkat sekitar 6 persen.
- Ukuran RAM berdampak langsung pada kecepatan. Mengurangi cache RAM menjadi setengahnya menurunkan throughput sekitar 15 persen. CPU menghabiskan waktu hampir sama banyaknya untuk menangani cache misses—melakukan de-quantise, menyalin, dan mengelola data—dengan waktu yang dihabiskan untuk menunggu disk.
Angka-angka ini mematahkan kepercayaan umum bahwa bandwidth penyimpanan adalah hambatan utama (choke point) untuk inferensi model besar pada laptop.
Mengapa RAM Lebih Unggul daripada SSD
Ketika parameter model belum tersedia di dalam RAM, sistem harus:
- Mengambil data dari SSD.
- Mendekodenya dan memindahkannya ke register CPU untuk komputasi.
Kedua langkah tersebut mengonsumsi siklus. Langkah pertama dibatasi oleh bandwidth SSD; langkah kedua menambah penundaan yang hampir sama karena CPU harus melakukan de-quantise pada data terlepas dari seberapa cepat data tersebut tiba. Oleh karena itu, SSD yang lebih cepat memberikan hasil yang semakin berkurang (diminishing returns), sementara RAM yang lebih besar memungkinkan lebih banyak bagian model tetap berada di memori dan menghilangkan proses bolak-balik (round-trip) yang memakan waktu.
Implikasi bagi Pengembang
- Berinvestasilah pada memori, bukan penyimpanan.
- Pengujian lokal menjadi layak. Pengembang dapat menjalankan model MoE open-weight pada mesin yang sudah ada, memeriksa gaya, perilaku tool-calling, dan kualitas output tanpa harus membayar kredit cloud.
- Evaluasi batch menjadi realistis. Chat real-time mungkin masih terasa lambat, tetapi pekerjaan yang antre—seperti menghasilkan puluhan prompt untuk penelitian—dapat berjalan dengan nyaman di laptop.
Potensi Argumen Penentang
Beberapa orang mungkin berargumen bahwa latensi SSD tetap berpengaruh untuk beban kerja yang berulang kali memuat bobot expert yang baru.
Apa yang Perlu Diperhatikan Selanjutnya
- Varian model yang efisien memori.
- Perangkat keras dengan cache on-chip yang lebih besar.
- Strategi caching pada tingkat perangkat lunak.
Intinya sudah jelas: pengembang yang ingin bereksperimen dengan model MoE masif pada laptop sebaiknya membeli lebih banyak RAM. Upgrade SSD hanya memangkas beberapa persen saja, sementara tambahan memori dapat memangkas waktu inferensi hingga belasan persen. Hal ini mengubah kalkulasi biaya untuk pembuatan prototipe AI dan membuka pintu bagi pengujian model secara lokal dan gratis, yang sebelumnya dianggap memerlukan klaster cloud khusus.
