اگر مدل‌های زبانی بزرگ را به‌صورت محلی روی یک Mac اجرا می‌کنید، احتمالاً به صفحه دانلود خیره شده و از خود پرسیده‌اید که چرا برای چیزی که به نظر یک مدل واحد می‌رسد، دو پوشه متفاوت وجود دارد. یکی با پسوند .gguf تمام می‌شود و به صورت یک فایل حجیم و واحد قرار دارد. دیگری یک دایرکتوری MLX است که پر از فایل‌های وزن (weights)، یک توکنایزر و برخی فایل‌های پیکربندی JSON است. هر دو ادعا می‌کنند که روی Apple Silicon به‌طور بهینه اجرا می‌شوند. اما فقط یکی از آن‌ها واقعاً در اکوسیستم اپل باقی می‌ماند.

این صرفاً یک تفاوت در بسته‌بندی نیست. انتخاب بین MLX و GGUF تعیین می‌کند که مدل شما با چه سرعتی اجرا شود، چقدر حافظه مصرف کند و آیا پروژه‌ی شما هرگز می‌تواند از لپ‌تاپ شما خارج شود یا خیر.

GGUF واقعاً چیست

GGUF از اکوسیستم llama.cpp بیرون آمده است. این یک فرمت کانتینر باینری است که وزن‌های مدل، واژگان توکنایزر، متادیتا و هایپرپارامترها را در یک فایل خودکفا بسته‌بندی می‌کند. شما می‌توانید یک فایل کوانتیزه شده واحد را بردارید، در یک پوشه قرار دهید و آن را روی تقریباً هر دستگاهی که دارای یک لودر سازگار باشد، اجرا کنید. این یعنی Metal در macOS، CUDA در Linux یا Windows، و حتی بک‌اندهای Vulkan یا فقط CPU در صورتی که GPU در دسترس نباشد.

برتری واقعی در اینجا قابلیت حمل (portability) است. از آنجایی که همه چیز در یک فایل قرار دارد، GGUF به‌راحتی جابه‌جا می‌شود. می‌توانید آن را از MacBook خود به یک سرور Linux منتقل کنید بدون اینکه نیاز به دانلود مجدد چیزی باشد. می‌توانید آن را در یک NAS آرشیو کنید و بدانید که یک سال دیگر، تنها با یک دستور آن را بارگذاری خواهید کرد. برای تیم‌هایی که سخت‌افزارهای مختلفی دارند، یا برای هر کسی که در حال ساخت زیرساختی است که ممکن است در نهایت در یک مرکز داده مستقر شود، این همه‌گیر بودن (ubiquity) غیرقابل رقابت است.

GGUF همچنین سال‌ها تحقیق دقیق در زمینه کوانتیزاسیون را از جامعه llama.cpp به ارث برده است. طرح‌های دقت ترکیبی (mixed-precision) مانند Q4_K_M و Q5_K_M برای حفظ کیفیت در پهنای بیت بسیار پایین تنظیم شده‌اند. این میراث زمانی اهمیت پیدا می‌کند که یک مدل ۷۰ میلیارد پارامتری را در ۴۰ گیگابایت فضای دیسک فشرده می‌کنید.

MLX چه مزایایی دارد

MLX فقط یک فرمت فایل نیست. این یک فریم‌ورک آرایه ساخته شده توسط اپل است که به‌طور اختصاصی برای یادگیری ماشین روی تراشه‌های سری M طراحی شده است. یک مدل MLX معمولاً به جای یک بلوک واحد، یک دایرکتوری از فایل‌ها است. این فریم‌ورک مستقیماً با بک‌اند Metal صحبت می‌کند و با حافظه CPU و GPU به عنوان یک استخر واحد (unified pool) برخورد می‌کند. در Apple Silicon، پردازنده مرکزی (CPU) و پردازنده گرافیکی (GPU) از تراشه‌های حافظه فیزیکی یکسانی استفاده می‌کنند، بنابراین MLX از کپی کردن‌های هزینه‌بر که به‌طور سنتی هنگام جابه‌جایی داده‌ها بین پردازنده و کارت گرافیک رخ می‌دهد، جلوگیری می‌کند.

نکته منفی مشخص است: MLX روی Windows اجرا نمی‌شود. روی Linux اجرا نمی‌شود. روی ماشین‌های دارای CUDA اجرا نمی‌شود. اگر گردش کار شما هرگز از اکوسیستم اپل خارج شود، نیاز خواهید داشت که مدل را به فرمت دیگری تبدیل کرده یا دوباره دانلود کنید.

برای توسعه‌دهندگان انفرادی که کاملاً با یک Mac Studio یا MacBook Pro کار می‌کنند، این محدودیت ممکن است اهمیتی نداشته باشد. اما برای هر کس دیگری، این یک دیوار است.

عملکرد در کجا قرار می‌گیرد

در Apple Silicon، معمولاً MLX گزینه سریع‌تری است. بنچمارک‌ها نشان می‌دهند که این فریم‌ورک بین ۱۵ تا ۴۰ درصد سریع‌تر از GGUF اجرا می‌شود که از طریق یک موتور مبتنی بر Metal روی همان مک بارگذاری شده است. در عمل، این شکاف یک پاسخ استریم کند ۲۰ ثانیه‌ای را به یک پاسخ سریع ۱۲ ثانیه‌ای تبدیل می‌کند. در طول یک جلسه طولانی کدنویسی یا یک گردش کار نوشتاری گسترده، این ثانیه‌ها به تجربه‌ای به‌مراتب روان‌تر تبدیل می‌شوند.

مصرف حافظه نیز الگوی مشابهی را دنبال می‌کند. MLX تمایل دارد تقریباً ۱۰ درصد RAM کمتری نسبت به یک مدل GGUF معادل مصرف کند. این صرفه‌جویی از معماری حافظه یکپارچه و نبود کپی‌های اضافی در بافر ناشی می‌شود. در دستگاهی با ۶۴ گیگابایت رم، ۱۰ درصد فضای تنفس راحتی است. در یک مک ۳۲ گیگابایتی، این می‌تواند تفاوت بین اجرای راحت یک مدل 13B و پر شدن حافظه و رفتن به swap باشد.

با این حال، یک موازنه در کیفیت وجود دارد. در کوانتیزاسیون ۴ بیتی، یک فایل GGUF که به‌خوبی با روش Q4_K_M تنظیم شده باشد، وفاداری خروجی کمی بهتری نسبت به یک تبدیل معمولی ۴ بیتی MLX حفظ می‌کند. ترفندهای دقت ترکیبی در GGUF در طول هزاران تست کاربر اصلاح شده‌اند. اگر وظیفه شما شامل استدلال دقیق، نحو (syntax) کدنویسی یا پیروی ظریف از دستورالعمل‌ها باشد، آن اختلاف کوچک در کیفیت ممکن است بیشتر از توان عملیاتی خام اهمیت داشته باشد.

سناریوهای واقعی، انتخاب‌های واقعی

تصور کنید توسعه‌دهنده‌ای با یک MacBook M3 Pro و ۳۶ گیگابایت حافظه یکپارچه هستید. شما تمام روز یک دستیار کدنویسی محلی را داخل VS Code اجرا می‌کنید. هرگز به یک ماشین Windows دست نمی‌زنید. در اینجا MLX منطقی است. سرعت اضافی باعث می‌شود تکمیل خودکار (autocomplete) آنی به نظر برسد و صرفه‌جویی در حافظه به شما اجازه می‌دهد مرورگری با پنجاه تب باز داشته باشید بدون اینکه سیستم را دچار اختلال کنید.

Now picture a researcher on a base M1 MacBook Air with 16 GB of RAM. They occasionally need to run the same analysis notebook on a departmental Linux server with NVIDIA cards. GGUF is the obvious pick. The single file simplifies backups, and the mixed-precision quantization wrings the best possible quality out of limited memory. When they SSH into the server, they can run the exact same weights without format conversion.

Or consider a small startup building a desktop AI tool. They prototype on Macs but know their customers use a mix of Windows laptops and Linux workstations. Betting on MLX early would paint them into a corner. GGUF keeps their deployment options open. One file. One pipeline. Every platform.

How to Decide

Your hardware and your future plans matter more than benchmarks.

Pick MLX if you own a modern M-series Mac with 32 GB of memory or more, you care only about local performance, and your project will never need to run on a non-Apple machine. The speedup is genuine, and the unified memory integration is elegant.

Pick GGUF if you have 16 GB of RAM or less, if you work across macOS and Linux, or if you are building anything that might one day sit on a server. It is also the better choice if you want the simplest possible setup: one file, one model, no dependency headaches.

Speed is easy to measure with a stopwatch. Portability only becomes visible when it vanishes. Build an MLX-only pipeline for a year, and the day you need to move inference to a CUDA server, you will feel the friction. Keep your project on a MacBook forever, and you will enjoy every frame of the MLX speedup without ever looking back.

The Bottom Line

Personal use on a 32 GB or larger Mac? MLX will give you the best native experience. Working with 16 GB, switching operating systems, or shipping to a server? GGUF is the safer, more flexible bet. If you genuinely cannot decide, default to GGUF. You sacrifice a little speed on Apple Silicon, but you gain the freedom to go anywhere.

Source: MLX vs GGUF on Apple Silicon: Which local LLM format should you actually use?

Want to talk local LLMs with other