Если вы запускаете большие языковые модели локально на Mac, вы, вероятно, уже смотрели на страницу загрузки и задавались вопросом, почему для одной и той же модели предлагаются две разные папки. Одна заканчивается на .gguf и представляет собой один тяжеловесный файл. Другая — это директория MLX, набитая файлами весов, токенизатором и несколькими JSON-конфигурациями. Обе претендуют на эффективную работу на Apple Silicon. Но только одна из них действительно остается внутри «сада» Apple.

Это не просто разница в упаковке. Выбор между MLX и GGUF определяет, насколько быстро будет работать ваша модель, сколько памяти она будет потреблять и сможет ли ваш проект когда-либо покинуть пределы вашего ноутбука.

Что такое GGUF на самом деле

GGUF появился в экосистеме llama.cpp. Это бинарный контейнерный формат, который объединяет веса модели, словарь токенизатора, метаданные и гиперпараметры в один самодостаточный файл. Вы можете взять один квантованный файл, поместить его в папку и запустить практически на любой машине с совместимым загрузчиком. Это означает Metal на macOS, CUDA на Linux или Windows и даже Vulkan или только CPU-бэкенды, если графический процессор недоступен.

Главное преимущество здесь — портативность. Поскольку всё находится в одном файле, GGUF легко перемещать. Вы можете перенести его с MacBook на Linux-сервер без необходимости что-либо перекачивать. Вы можете архивировать его на NAS и знать, что через год одна команда позволит его загрузить. Для команд, использующих разное оборудование, или для тех, кто строит инфраструктуру, которая в конечном итоге может быть развернута в дата-центре, такая универсальность неоспорима.

GGUF также наследует годы тщательных исследований в области квантования от сообщества llama.cpp. Схемы смешанной точности, такие как Q4_K_M и Q5_K_M, были настроены для сохранения качества при очень низкой разрядности. Это наследие имеет значение, когда вы пытаетесь уместить модель с 70 миллиардами параметров в 40 гигабайт дискового пространства.

Что предлагает MLX

MLX — это не просто формат файла. Это разработанный Apple фреймворк для работы с массивами, созданный специально для машинного обучения на чипах серии M. Модель MLX обычно представляет собой директорию файлов, а не единый массив данных. Фреймворк напрямую взаимодействует с бэкендом Metal и рассматривает память CPU и GPU как единый пул. В Apple Silicon центральный и графический процессоры используют одну и ту же физическую память, поэтому MLX избегает дорогостоящего копирования данных, которое традиционно происходит при перемещении данных между процессором и видеокартой.

Подвох очевиден: MLX не работает на Windows. Он не работает на Linux. Он не работает на машинах с CUDA. Если ваш рабочий процесс когда-либо выйдет за пределы экосистемы Apple, вам придется конвертировать или заново скачивать модель в другом формате.

Для соло-разработчиков, живущих исключительно на Mac Studio или MacBook Pro, это ограничение может ничего не значить. Для всех остальных это стена.

Сравнение производительности

На Apple Silicon MLX обычно является более быстрым вариантом. Бенчмарки показывают, что он работает на 15–40% быстрее, чем GGUF, загруженный через движок с поддержкой Metal на том же Mac. На практике этот разрыв превращает вялый 20-секундный потоковый ответ в бодрый 12-секундный. В ходе долгой сессии кодинга или длительного процесса написания текста эти секунды накапливаются, обеспечивая заметно более плавную работу.

Потребление памяти следует схожей закономерности. MLX, как правило, потребляет примерно на 10% меньше оперативной памяти, чем эквивалентная модель GGUF. Эта экономия достигается за счет архитектуры объединенной памяти и отсутствия лишних копий буфера. На машине с 64 ГБ оперативной памяти 10% — это комфортный запас. На 32-гигабайтном Mac это может стать решающим фактором между комфортным размещением модели 13B и ухода в своп.

Однако есть компромисс в качестве. При 4-битном квантовании хорошо настроенный файл GGUF с использованием метода Q4_K_M сохраняет чуть более высокую точность вывода, чем типичная 4-битная конверсия MLX. Трюки со смешанной точностью в GGUF были отточены в ходе тысяч пользовательских тестов. Если ваша задача требует точных рассуждений, соблюдения синтаксиса кода или нюансов в следовании инструкциям, эта небольшая разница в качестве может оказаться важнее, чем чистая пропускная способность.

Реальные сценарии, реальный выбор

Представьте, что вы разработчик с MacBook M3 Pro и 36 ГБ объединенной памяти. Вы весь день используете локального ИИ-ассистента в VS Code. Вы никогда не прикасаетесь к Windows-машинам. В этом случае MLX имеет смысл. Дополнительная скорость делает автодополнение мгновенным, а экономия памяти позволяет держать браузер с пятьюдесятью открытыми вкладками, не перегружая систему.

Now picture a researcher on a base M1 MacBook Air with 16 GB of RAM. They occasionally need to run the same analysis notebook on a departmental Linux server with NVIDIA cards. GGUF is the obvious pick. The single file simplifies backups, and the mixed-precision quantization wrings the best possible quality out of limited memory. When they SSH into the server, they can run the exact same weights without format conversion.

Or consider a small startup building a desktop AI tool. They prototype on Macs but know their customers use a mix of Windows laptops and Linux workstations. Betting on MLX early would paint them into a corner. GGUF keeps their deployment options open. One file. One pipeline. Every platform.

How to Decide

Your hardware and your future plans matter more than benchmarks.

Pick MLX if you own a modern M-series Mac with 32 GB of memory or more, you care only about local performance, and your project will never need to run on a non-Apple machine. The speedup is genuine, and the unified memory integration is elegant.

Pick GGUF if you have 16 GB of RAM or less, if you work across macOS and Linux, or if you are building anything that might one day sit on a server. It is also the better choice if you want the simplest possible setup: one file, one model, no dependency headaches.

Speed is easy to measure with a stopwatch. Portability only becomes visible when it vanishes. Build an MLX-only pipeline for a year, and the day you need to move inference to a CUDA server, you will feel the friction. Keep your project on a MacBook forever, and you will enjoy every frame of the MLX speedup without ever looking back.

The Bottom Line

Personal use on a 32 GB or larger Mac? MLX will give you the best native experience. Working with 16 GB, switching operating systems, or shipping to a server? GGUF is the safer, more flexible bet. If you genuinely cannot decide, default to GGUF. You sacrifice a little speed on Apple Silicon, but you gain the freedom to go anywhere.

Source: MLX vs GGUF on Apple Silicon: Which local LLM format should you actually use?

Want to talk local LLMs with other