Якщо ви запускаєте великі мовні моделі локально на Mac, ви, ймовірно, дивилися на сторінку завантаження і дивувалися, чому існують дві різні папки для того, що виглядає як одна й та сама модель. Одна закінчується на .gguf і постає у вигляді одного великого файлу. Інша — це директорія MLX, наповнена файлами ваг, токенізатором та деякими JSON-конфігураціями. Обидві обіцяють ефективну роботу на Apple Silicon. Але лише одна з них насправді залишається в межах екосистеми Apple.

Це не просто різниця в пакуванні. Вибір між MLX та GGUF визначає, наскільки швидко працюватиме ваша модель, скільки пам'яті вона споживатиме і чи зможе ваш проєкт колись покинути ваш ноутбук.

Що таке GGUF насправді

GGUF походить з екосистеми llama.cpp. Це формат бінарного контейнера, який об'єднує ваги моделі, словник токенізатора, метадані та гіперпараметри в один самодостатній файл. Ви можете взяти один квантований файл, покласти його в папку і запустити майже на будь-якому пристрої з сумісним завантажувачем. Це означає Metal на macOS, CUDA на Linux або Windows і навіть Vulkan або лише CPU-бекенди, якщо GPU недоступний.

Справжня перевага тут — портативність. Оскільки все міститься в одному файлі, GGUF легко переносити. Ви можете перемістити його зі свого MacBook на Linux-сервер без повторного завантаження. Ви можете архівувати його на NAS і знати, що через рік одна команда завантажить його. Для команд, які використовують різне обладнання, або для тих, хто будує інфраструктуру, яка згодом може бути розгорнута в центрі обробки даних, таку універсальність важко перевершити.

GGUF також успадкує роки ретельних досліджень квантування від спільноти llama.cpp. Схеми змішаної точності, такі як Q4_K_M та Q5_K_M, були налаштовані для збереження якості при дуже низькій розрядності. Ця спадщина має значення, коли ви стискаєте модель із 70 мільярдами параметрів у 40 гігабайтів дискового простору.

Що пропонує MLX

MLX — це не просто формат файлу. Це розроблений Apple фреймворк масивів, створений спеціально для машинного навчання на чіпах серії M. Модель MLX зазвичай являє собою директорію файлів, а не один цілісний об'єкт. Фреймворк взаємодіє безпосередньо з Metal-бекендом і розглядає пам'ять CPU та GPU як єдиний спільний пул. На Apple Silicon CPU та GPU використовують одні й ті самі фізичні чіпи пам'яті, тому MLX уникає дороговартісного копіювання, яке зазвичай відбувається під час переміщення даних між процесором і відеокартою.

Підвох очевидний: MLX не працює на Windows. Він не працює на Linux. Він не працює на машинах з CUDA. Якщо ваш робочий процес колись вийде за межі екосистеми Apple, вам доведеться конвертувати або завантажувати модель у іншому форматі.

Для розробників-одинаків, які працюють виключно на Mac Studio або MacBook Pro, це обмеження може нічого не означати. Для всіх інших це стіна.

Де шукати продуктивність

На Apple Silicon MLX зазвичай є швидшим варіантом. Тести показують, що він працює на 15–40 відсотків швидше, ніж GGUF, завантажений через двигун на базі Metal на тому самому Mac. На практиці ця різниця перетворює повільну 20-секундну потокову відповідь на швидку 12-секундну. Протягом тривалої сесії програмування або тривалого процесу написання тексту ці секунди накопичуються, забезпечуючи помітно плавнішу роботу.

Використання пам'яті демонструє схожу закономірність. MLX схильний споживати приблизно на 10 відсотків менше оперативної пам'яті, ніж еквівалентна модель GGUF. Ця економія досягається завдяки архітектурі об'єднаної пам'яті та відсутності додаткових копій буфера. На машині з 64 ГБ оперативної пам'яті 10 відсотків — це комфортний запас. На 32-гігабайтному Mac це може бути різницею між комфортним розміщенням моделі 13B та переходом у режим swap.

Проте існує компроміс щодо якості. При 4-бітному квантуванні добре налаштований файл GGUF з використанням методу Q4_K_M зберігає трохи вищу точність результату, ніж типова 4-бітна конверсія MLX. Трюки зі змішаною точністю в GGUF були вдосконалені в результаті тисяч користувацьких тестів. Якщо ваше завдання передбачає точне міркування, синтаксис коду або нюансоване виконання інструкцій, ця невелика різниця в якості може мати більше значення, ніж чиста пропускна здатність.

Реальні сценарії, реальний вибір

Уявіть, що ви розробник із MacBook M3 Pro та 36 ГБ об'єднаної пам'яті. Ви цілий день використовуєте локального помічника для програмування всередині VS Code. Ви ніколи не торкаєтеся Windows-машин. У цьому випадку MLX має сенс. Додаткова швидкість робить автодоповнення миттєвим, а економія пам'яті дозволяє тримати браузер із п'ятдесятьма відкритими вкладками, не перевантажуючи систему.

Now picture a researcher on a base M1 MacBook Air with 16 GB of RAM. They occasionally need to run the same analysis notebook on a departmental Linux server with NVIDIA cards. GGUF is the obvious pick. The single file simplifies backups, and the mixed-precision quantization wrings the best possible quality out of limited memory. When they SSH into the server, they can run the exact same weights without format conversion.

Or consider a small startup building a desktop AI tool. They prototype on Macs but know their customers use a mix of Windows laptops and Linux workstations. Betting on MLX early would paint them into a corner. GGUF keeps their deployment options open. One file. One pipeline. Every platform.

How to Decide

Your hardware and your future plans matter more than benchmarks.

Pick MLX if you own a modern M-series Mac with 32 GB of memory or more, you care only about local performance, and your project will never need to run on a non-Apple machine. The speedup is genuine, and the unified memory integration is elegant.

Pick GGUF if you have 16 GB of RAM or less, if you work across macOS and Linux, or if you are building anything that might one day sit on a server. It is also the better choice if you want the simplest possible setup: one file, one model, no dependency headaches.

Speed is easy to measure with a stopwatch. Portability only becomes visible when it vanishes. Build an MLX-only pipeline for a year, and the day you need to move inference to a CUDA server, you will feel the friction. Keep your project on a MacBook forever, and you will enjoy every frame of the MLX speedup without ever looking back.

The Bottom Line

Personal use on a 32 GB or larger Mac? MLX will give you the best native experience. Working with 16 GB, switching operating systems, or shipping to a server? GGUF is the safer, more flexible bet. If you genuinely cannot decide, default to GGUF. You sacrifice a little speed on Apple Silicon, but you gain the freedom to go anywhere.

Source: MLX vs GGUF on Apple Silicon: Which local LLM format should you actually use?

Want to talk local LLMs with other