Jika anda menjalankan model bahasa besar secara tempatan pada Mac, anda mungkin pernah merenung halaman muat turun dan tertanya-tanya mengapa terdapat dua folder berbeza untuk apa yang kelihatan seperti model yang sama. Satu berakhir dengan .gguf dan wujud sebagai satu fail tunggal yang besar. Satu lagi ialah direktori MLX yang dipenuhi dengan fail pemberat (weights), tokenizer, dan beberapa konfigurasi JSON. Kedua-duanya mendakwa boleh berjalan dengan cekap pada Apple Silicon. Namun, hanya satu daripadanya yang benar-benar kekal dalam ekosistem Apple.
Ini bukan sekadar perbezaan pembungkusan. Pilihan antara MLX dan GGUF menentukan betapa pantas model anda berjalan, berapa banyak memori yang digunakan, dan sama ada projek anda boleh dibawa keluar daripada komputer riba anda.
Apa Sebenarnya GGUF
GGUF berasal daripada ekosistem llama.cpp. Ia adalah format kontena binari yang menggabungkan pemberat model, kosa kata tokenizer, metadata, dan hiperparameter ke dalam satu fail kendiri. Anda boleh mengambil satu fail kuantisasi, letakkannya ke dalam folder, dan menjalankannya pada hampir mana-mana mesin yang mempunyai pemuat (loader) yang serasi. Ini bermakna Metal pada macOS, CUDA pada Linux atau Windows, malah backend Vulkan atau CPU sahaja jika GPU tidak tersedia.
Kelebihan sebenar di sini ialah kebolehalihan (portability). Oleh kerana semuanya berada dalam satu fail, GGUF mudah dipindahkan. Anda boleh memindahkannya dari MacBook anda ke pelayan Linux tanpa perlu memuat turun semula apa-apa. Anda boleh menyimpannya dalam arkib pada NAS dan tahu bahawa setahun dari sekarang, satu arahan sahaja akan memuatkannya. Bagi pasukan yang menggunakan pelbagai perkakasan, atau sesiapa sahaja yang membina infrastruktur yang mungkin akhirnya akan digunakan di pusat data, kebolehgunaan meluas ini sukar ditandingi.
GGUF juga mewarisi penyelidikan kuantisasi yang teliti selama bertahun-tahun daripada komuniti llama.cpp. Skema ketepatan campuran (mixed-precision) seperti Q4_K_M dan Q5_K_M telah ditala untuk mengekalkan kualiti pada lebar bit yang sangat rendah. Legasi tersebut sangat penting apabila anda memampatkan model dengan 70 bilion parameter ke dalam ruang cakera sebanyak 40 gigabait.
Apa yang Ditawarkan oleh MLX
MLX bukan sekadar format fail. Ia adalah rangka kerja tatasusunan (array framework) buatan Apple yang direka khusus untuk pembelajaran mesin pada cip siri-M. Model MLX biasanya merupakan sebuah direktori fail dan bukannya satu blok data tunggal. Rangka kerja ini berkomunikasi secara terus dengan backend Metal dan menganggap memori CPU dan GPU sebagai satu kolam (pool) yang bersatu. Pada Apple Silicon, CPU dan GPU berkongsi cip memori fizikal yang sama, jadi MLX mengelakkan proses penyalinan data yang memakan masa yang biasanya berlaku apabila data berpindah antara pemproses dan kad grafik.
Kekurangannya jelas: MLX tidak berjalan pada Windows. Ia tidak berjalan pada Linux. Ia tidak berjalan pada mesin CUDA. Jika aliran kerja anda beralih daripada ekosistem Apple, anda perlu menukar atau memuat turun semula model tersebut dalam format yang berbeza.
Bagi pembangun solo yang menggunakan Mac Studio atau MacBook Pro sepenuhnya, had tersebut mungkin tidak bermakna apa-apa. Bagi orang lain, ia adalah satu halangan besar.
Di Mana Kedudukan Prestasi
Pada Apple Silicon, MLX biasanya merupakan pilihan yang lebih pantas. Penanda aras menunjukkan ia berjalan antara 15 hingga 40 peratus lebih cepat berbanding GGUF yang dimuatkan melalui enjin berasaskan Metal pada Mac yang sama. Dalam praktiknya, jurang tersebut mengubah respons penstriman yang lembap selama 20 saat kepada respons yang pantas selama 12 saat. Sepanjang sesi pengekodan yang lama atau aliran kerja penulisan yang panjang, saat-saat tersebut terkumpul menjadi pengalaman yang jauh lebih lancar.
Penggunaan memori mengikut corak yang sama. MLX cenderung menggunakan kira-kira 10 peratus kurang RAM berbanding model GGUF yang setara. Penjimatan itu datang daripada seni bina memori bersatu dan ketiadaan salinan penimbal (buffer) tambahan. Pada mesin dengan RAM 64 GB, 10 peratus adalah ruang bernafas yang selesa. Pada Mac 32 GB, ia boleh menjadi perbezaan antara memuatkan model 13B dengan selesa atau terpaksa menggunakan swap.
Walau bagaimanapun, terdapat pertukaran (trade-off) dari segi kualiti. Pada kuantisasi 4-bit, fail GGUF yang ditala dengan baik menggunakan kaedah Q4_K_M mengekalkan kesetiaan (fidelity) output yang sedikit lebih baik berbanding penukaran MLX 4-bit yang tipikal. Teknik ketepatan campuran dalam GGUF telah diperhalusi melalui ribuan ujian pengguna. Jika tugas anda melibatkan penaakulan yang tepat, sintaks pengekodan, atau pematuhan arahan yang bernuansa, perbezaan kecil dalam kualiti itu mungkin lebih penting daripada kadar pemprosesan (throughput) mentah.
Senario Sebenar, Pilihan Sebenar
Bayangkan anda seorang pembangun dengan MacBook M3 Pro dan 36 GB memori bersatu. Anda menjalankan pembantu pengekodan tempatan di dalam VS Code sepanjang hari. Anda tidak pernah menyentuh mesin Windows. MLX adalah pilihan yang masuk akal di sini. Kelajuan tambahan menjadikan fungsi melengkapkan automatik (autocomplete) terasa sekelip mata, dan penjimatan memori membolehkan anda mengekalkan pelayar dengan lima puluh tab terbuka tanpa membebankan sistem.
Bayangkan seorang penyelidik yang menggunakan MacBook Air M1 asas dengan RAM 16 GB. Mereka sesekali perlu menjalankan buku nota analisis yang sama pada pelayan Linux jabatan dengan kad NVIDIA. GGUF adalah pilihan yang jelas. Fail tunggal tersebut memudahkan sandaran, dan kuantisasi ketepatan campuran (mixed-precision quantization) memberikan kualiti terbaik yang mungkin daripada memori yang terhad. Apabila mereka SSH ke dalam pelayan, mereka boleh menjalankan pemberat (weights) yang sama tepat tanpa penukaran format.
Atau pertimbangkan sebuah syarikat pemula (startup) kecil yang membina alat AI desktop. Mereka membina prototaip pada Mac tetapi tahu pelanggan mereka menggunakan campuran komputer riba Windows dan stesen kerja Linux. Bertaruh pada MLX terlalu awal akan menyukarkan kedudukan mereka kelak. GGUF memastikan pilihan deployment mereka tetap terbuka. Satu fail. Satu pipeline. Setiap platform.
Cara Membuat Keputusan
Perkakasan anda dan rancangan masa depan anda lebih penting daripada penanda aras (benchmarks).
Pilih MLX jika anda memiliki Mac siri-M moden dengan memori 32 GB atau lebih, anda hanya mementingkan prestasi tempatan, dan projek anda tidak akan perlu dijalankan pada mesin bukan Apple. Peningkatan kelajuannya adalah nyata, dan integrasi memori bersatu (unified memory) adalah sangat kemas.
Pilih GGUF jika anda mempunyai RAM 16 GB atau kurang, jika anda bekerja merentasi macOS dan Linux, atau jika anda sedang membina apa-apa yang mungkin suatu hari nanti akan diletakkan pada pelayan. Ia juga merupakan pilihan yang lebih baik jika anda mahukan persediaan yang paling ringkas: satu fail, satu model, tanpa masalah kebergantungan (dependency).
Kelajuan mudah diukur dengan jam randuk. Kebolehupayaan (portability) hanya akan kelihatan apabila ia hilang. Bina pipeline khusus MLX selama setahun, dan pada hari anda perlu memindahkan inferens ke pelayan CUDA, anda akan merasai kesulitannya. Kekalkan projek anda pada MacBook selamanya, dan anda akan menikmati setiap bingkai peningkatan kelajuan MLX tanpa perlu menoleh ke belakang.
Kesimpulannya
Kegunaan peribadi pada Mac 32 GB atau lebih besar? MLX akan memberikan anda pengalaman asli yang terbaik. Bekerja dengan 16 GB, bertukar sistem operasi, atau menghantar ke pelayan? GGUF adalah pertaruhan yang lebih selamat dan fleksibel. Jika anda benar-benar tidak dapat membuat keputusan, pilih GGUF sebagai lalai (default). Anda mengorbankan sedikit kelajuan pada Apple Silicon, tetapi anda mendapat kebebasan untuk pergi ke mana sahaja.
Sumber: MLX vs GGUF on Apple Silicon: Which local LLM format should you actually use?
Ingin berbincang tentang LLM tempatan dengan yang lain
