اگر مدلهای زبانی بزرگ را بهصورت محلی روی یک Mac اجرا میکنید، احتمالاً به صفحه دانلود خیره شده و از خود پرسیدهاید که چرا برای چیزی که به نظر یک مدل واحد میرسد، دو پوشه متفاوت وجود دارد. یکی با پسوند .gguf تمام میشود و به صورت یک فایل حجیم و واحد قرار دارد. دیگری یک دایرکتوری MLX است که پر از فایلهای وزن (weights)، یک توکنایزر و برخی فایلهای پیکربندی JSON است. هر دو ادعا میکنند که روی Apple Silicon بهطور بهینه اجرا میشوند. اما فقط یکی از آنها واقعاً در اکوسیستم اپل باقی میماند.
این صرفاً یک تفاوت در بستهبندی نیست. انتخاب بین MLX و GGUF تعیین میکند که مدل شما با چه سرعتی اجرا شود، چقدر حافظه مصرف کند و آیا پروژهی شما هرگز میتواند از لپتاپ شما خارج شود یا خیر.
GGUF واقعاً چیست
GGUF از اکوسیستم llama.cpp بیرون آمده است. این یک فرمت کانتینر باینری است که وزنهای مدل، واژگان توکنایزر، متادیتا و هایپرپارامترها را در یک فایل خودکفا بستهبندی میکند. شما میتوانید یک فایل کوانتیزه شده واحد را بردارید، در یک پوشه قرار دهید و آن را روی تقریباً هر دستگاهی که دارای یک لودر سازگار باشد، اجرا کنید. این یعنی Metal در macOS، CUDA در Linux یا Windows، و حتی بکاندهای Vulkan یا فقط CPU در صورتی که GPU در دسترس نباشد.
برتری واقعی در اینجا قابلیت حمل (portability) است. از آنجایی که همه چیز در یک فایل قرار دارد، GGUF بهراحتی جابهجا میشود. میتوانید آن را از MacBook خود به یک سرور Linux منتقل کنید بدون اینکه نیاز به دانلود مجدد چیزی باشد. میتوانید آن را در یک NAS آرشیو کنید و بدانید که یک سال دیگر، تنها با یک دستور آن را بارگذاری خواهید کرد. برای تیمهایی که سختافزارهای مختلفی دارند، یا برای هر کسی که در حال ساخت زیرساختی است که ممکن است در نهایت در یک مرکز داده مستقر شود، این همهگیر بودن (ubiquity) غیرقابل رقابت است.
GGUF همچنین سالها تحقیق دقیق در زمینه کوانتیزاسیون را از جامعه llama.cpp به ارث برده است. طرحهای دقت ترکیبی (mixed-precision) مانند Q4_K_M و Q5_K_M برای حفظ کیفیت در پهنای بیت بسیار پایین تنظیم شدهاند. این میراث زمانی اهمیت پیدا میکند که یک مدل ۷۰ میلیارد پارامتری را در ۴۰ گیگابایت فضای دیسک فشرده میکنید.
MLX چه مزایایی دارد
MLX فقط یک فرمت فایل نیست. این یک فریمورک آرایه ساخته شده توسط اپل است که بهطور اختصاصی برای یادگیری ماشین روی تراشههای سری M طراحی شده است. یک مدل MLX معمولاً به جای یک بلوک واحد، یک دایرکتوری از فایلها است. این فریمورک مستقیماً با بکاند Metal صحبت میکند و با حافظه CPU و GPU به عنوان یک استخر واحد (unified pool) برخورد میکند. در Apple Silicon، پردازنده مرکزی (CPU) و پردازنده گرافیکی (GPU) از تراشههای حافظه فیزیکی یکسانی استفاده میکنند، بنابراین MLX از کپی کردنهای هزینهبر که بهطور سنتی هنگام جابهجایی دادهها بین پردازنده و کارت گرافیک رخ میدهد، جلوگیری میکند.
نکته منفی مشخص است: MLX روی Windows اجرا نمیشود. روی Linux اجرا نمیشود. روی ماشینهای دارای CUDA اجرا نمیشود. اگر گردش کار شما هرگز از اکوسیستم اپل خارج شود، نیاز خواهید داشت که مدل را به فرمت دیگری تبدیل کرده یا دوباره دانلود کنید.
برای توسعهدهندگان انفرادی که کاملاً با یک Mac Studio یا MacBook Pro کار میکنند، این محدودیت ممکن است اهمیتی نداشته باشد. اما برای هر کس دیگری، این یک دیوار است.
عملکرد در کجا قرار میگیرد
در Apple Silicon، معمولاً MLX گزینه سریعتری است. بنچمارکها نشان میدهند که این فریمورک بین ۱۵ تا ۴۰ درصد سریعتر از GGUF اجرا میشود که از طریق یک موتور مبتنی بر Metal روی همان مک بارگذاری شده است. در عمل، این شکاف یک پاسخ استریم کند ۲۰ ثانیهای را به یک پاسخ سریع ۱۲ ثانیهای تبدیل میکند. در طول یک جلسه طولانی کدنویسی یا یک گردش کار نوشتاری گسترده، این ثانیهها به تجربهای بهمراتب روانتر تبدیل میشوند.
مصرف حافظه نیز الگوی مشابهی را دنبال میکند. MLX تمایل دارد تقریباً ۱۰ درصد RAM کمتری نسبت به یک مدل GGUF معادل مصرف کند. این صرفهجویی از معماری حافظه یکپارچه و نبود کپیهای اضافی در بافر ناشی میشود. در دستگاهی با ۶۴ گیگابایت رم، ۱۰ درصد فضای تنفس راحتی است. در یک مک ۳۲ گیگابایتی، این میتواند تفاوت بین اجرای راحت یک مدل 13B و پر شدن حافظه و رفتن به swap باشد.
با این حال، یک موازنه در کیفیت وجود دارد. در کوانتیزاسیون ۴ بیتی، یک فایل GGUF که بهخوبی با روش Q4_K_M تنظیم شده باشد، وفاداری خروجی کمی بهتری نسبت به یک تبدیل معمولی ۴ بیتی MLX حفظ میکند. ترفندهای دقت ترکیبی در GGUF در طول هزاران تست کاربر اصلاح شدهاند. اگر وظیفه شما شامل استدلال دقیق، نحو (syntax) کدنویسی یا پیروی ظریف از دستورالعملها باشد، آن اختلاف کوچک در کیفیت ممکن است بیشتر از توان عملیاتی خام اهمیت داشته باشد.
سناریوهای واقعی، انتخابهای واقعی
تصور کنید توسعهدهندهای با یک MacBook M3 Pro و ۳۶ گیگابایت حافظه یکپارچه هستید. شما تمام روز یک دستیار کدنویسی محلی را داخل VS Code اجرا میکنید. هرگز به یک ماشین Windows دست نمیزنید. در اینجا MLX منطقی است. سرعت اضافی باعث میشود تکمیل خودکار (autocomplete) آنی به نظر برسد و صرفهجویی در حافظه به شما اجازه میدهد مرورگری با پنجاه تب باز داشته باشید بدون اینکه سیستم را دچار اختلال کنید.
Now picture a researcher on a base M1 MacBook Air with 16 GB of RAM. They occasionally need to run the same analysis notebook on a departmental Linux server with NVIDIA cards. GGUF is the obvious pick. The single file simplifies backups, and the mixed-precision quantization wrings the best possible quality out of limited memory. When they SSH into the server, they can run the exact same weights without format conversion.
Or consider a small startup building a desktop AI tool. They prototype on Macs but know their customers use a mix of Windows laptops and Linux workstations. Betting on MLX early would paint them into a corner. GGUF keeps their deployment options open. One file. One pipeline. Every platform.
How to Decide
Your hardware and your future plans matter more than benchmarks.
Pick MLX if you own a modern M-series Mac with 32 GB of memory or more, you care only about local performance, and your project will never need to run on a non-Apple machine. The speedup is genuine, and the unified memory integration is elegant.
Pick GGUF if you have 16 GB of RAM or less, if you work across macOS and Linux, or if you are building anything that might one day sit on a server. It is also the better choice if you want the simplest possible setup: one file, one model, no dependency headaches.
Speed is easy to measure with a stopwatch. Portability only becomes visible when it vanishes. Build an MLX-only pipeline for a year, and the day you need to move inference to a CUDA server, you will feel the friction. Keep your project on a MacBook forever, and you will enjoy every frame of the MLX speedup without ever looking back.
The Bottom Line
Personal use on a 32 GB or larger Mac? MLX will give you the best native experience. Working with 16 GB, switching operating systems, or shipping to a server? GGUF is the safer, more flexible bet. If you genuinely cannot decide, default to GGUF. You sacrifice a little speed on Apple Silicon, but you gain the freedom to go anywhere.
Source: MLX vs GGUF on Apple Silicon: Which local LLM format should you actually use?
Want to talk local LLMs with other
