Mac에서 로컬로 대규모 언어 모델(LLM)을 실행해 본 적이 있다면, 똑같아 보이는 모델인데 왜 다운로드 페이지에는 서로 다른 두 개의 폴더가 있는지 의아해하며 한참을 바라본 적이 있을 것입니다. 하나는 .gguf로 끝나는 하나의 커다란 파일이고, 다른 하나는 가중치 파일, 토크나이저, 그리고 몇몇 JSON 설정 파일이 들어 있는 MLX 디렉토리입니다. 둘 다 Apple Silicon에서 효율적으로 작동한다고 하지만, 실제로 Apple 생태계 안에서만 작동하는 것은 하나뿐입니다.

이것은 단순한 패키징의 차이가 아닙니다. MLX와 GGUF 중 무엇을 선택하느냐에 따라 모델의 실행 속도, 메모리 점유율, 그리고 여러분의 프로젝트가 노트북을 벗어나 다른 환경으로 확장될 수 있는지 여부가 결정됩니다.

GGUF의 실체

GGUF는 llama.cpp 생태계에서 탄생했습니다. 이는 모델 가중치, 토크나이저 어휘(vocabulary), 메타데이터, 하이퍼파라미터를 하나의 독립된 파일로 묶는 바이너리 컨테이너 형식입니다. 양자화된 단일 파일을 가져와 폴더에 넣기만 하면, 호환되는 로더가 있는 거의 모든 기기에서 실행할 수 있습니다. 즉, macOS의 Metal, Linux나 Windows의 CUDA, 그리고 GPU가 없는 경우 Vulkan이나 CPU 전용 백엔드까지 지원한다는 의미입니다.

여기서 얻는 진짜 이점은 휴대성(portability)입니다. 모든 것이 하나의 파일에 담겨 있기 때문에 GGUF는 이동이 매우 간편합니다. 아무것도 다시 다운로드할 필요 없이 MacBook에서 Linux 서버로 옮길 수 있습니다. NAS에 보관해 두어도 1년 뒤에 명령어 하나만으로 바로 불러올 수 있습니다. 다양한 하드웨어를 혼용하는 팀이나, 향후 데이터 센터에 배포할 인프라를 구축하는 사람들에게 이러한 범용성은 매우 강력한 장점입니다.

또한 GGUF는 llama.cpp 커뮤니티의 수년간에 걸친 세심한 양자화 연구를 계승합니다. Q4_K_MQ5_K_M과 같은 혼합 정밀도(mixed-precision) 방식은 매우 낮은 비트 너비에서도 품질을 유지하도록 조정되었습니다. 700억 개의 파라미터를 가진 모델을 40GB의 디스크 공간에 압축해야 할 때, 이러한 기술적 유산은 매우 중요합니다.

MLX의 강점

MLX는 단순한 파일 형식이 아닙니다. M 시리즈 칩에서 머신러닝을 수행하기 위해 Apple이 직접 설계한 어레이(array) 프레임워크입니다. MLX 모델은 보통 단일 파일이 아닌 파일들의 디렉토리 형태로 구성됩니다. 이 프레임워크는 Metal 백엔드와 직접 통신하며, CPU와 GPU 메모리를 하나의 통합된 풀(unified pool)로 취급합니다. Apple Silicon에서는 CPU와 GPU가 동일한 물리적 메모리 칩을 공유하므로, MLX는 데이터가 프로세서와 그래픽 카드 사이를 오갈 때 발생하는 비용이 큰 복사 과정을 피할 수 있습니다.

단점은 명확합니다. MLX는 Windows에서 실행되지 않습니다. Linux에서도, CUDA 머신에서도 실행되지 않습니다. 워크플로우가 Apple 생태계를 벗어나게 된다면, 모델을 다른 형식으로 변환하거나 다시 다운로드해야 합니다.

Mac Studio나 MacBook Pro만 사용하는 개인 개발자에게 이 제약은 아무런 문제가 되지 않을 수 있습니다. 하지만 그 외의 경우에는 거대한 장벽이 됩니다.

성능 비교

Apple Silicon 환경에서는 일반적으로 MLX가 더 빠른 옵션입니다. 벤치마크에 따르면 동일한 Mac에서 Metal 기반 엔진을 통해 로드된 GGUF보다 15%에서 40% 더 빠르게 작동합니다. 실제로 이 차이는 답답했던 20초의 스트리밍 응답을 빠릿빠릿한 12초의 응답으로 바꿔줍니다. 긴 코딩 세션이나 장시간의 글쓰기 작업 중에 이러한 초 단위의 차이는 체감할 수 있을 정도로 매끄러운 경험을 만들어냅니다.

메모리 사용량도 비슷한 패턴을 보입니다. MLX는 동일한 GGUF 모델보다 RAM을 약 10% 적게 사용하는 경향이 있습니다. 이러한 절약은 통합 메모리 아키텍처와 불필요한 버퍼 복사가 없기 때문에 가능합니다. 64GB RAM을 가진 기기에서 10%는 여유로운 숨통이 됩니다. 32GB Mac에서는 13B 모델을 안정적으로 돌릴 수 있느냐, 아니면 스왑(swap)이 발생하느냐를 결정짓는 차이가 될 수 있습니다.

하지만 품질 측면에서의 트레이드오프(trade-off)가 존재합니다. 4비트 양자화 시, Q4_K_M 방식을 사용하는 잘 조정된 GGUF 파일은 일반적인 4비트 MLX 변환 모델보다 약간 더 나은 출력 충실도(fidelity)를 유지합니다. GGUF의 혼합 정밀도 기술은 수천 번의 사용자 테스트를 통해 정교해졌습니다. 만약 정밀한 추론, 코딩 구문, 또는 미묘한 지시 사항 이행이 필요한 작업이라면, 단순한 처리량(throughput)보다 이러한 미세한 품질 차이가 더 중요할 수 있습니다.

실제 시나리오와 선택

M3 Pro MacBook과 36GB의 통합 메모리를 가진 개발자라고 가정해 봅시다. 당신은 하루 종일 VS Code 내에서 로컬 코딩 어시스턴트를 실행하며, Windows 기기는 전혀 사용하지 않습니다. 이 경우 MLX가 합리적인 선택입니다. 추가적인 속도 덕분에 자동 완성이 즉각적으로 느껴지며, 메모리 절약 덕분에 시스템에 무리를 주지 않고도 탭을 50개나 띄워놓은 브라우저를 동시에 사용할 수 있습니다.

Now picture a researcher on a base M1 MacBook Air with 16 GB of RAM. They occasionally need to run the same analysis notebook on a departmental Linux server with NVIDIA cards. GGUF is the obvious pick. The single file simplifies backups, and the mixed-precision quantization wrings the best possible quality out of limited memory. When they SSH into the server, they can run the exact same weights without format conversion.

Or consider a small startup building a desktop AI tool. They prototype on Macs but know their customers use a mix of Windows laptops and Linux workstations. Betting on MLX early would paint them into a corner. GGUF keeps their deployment options open. One file. One pipeline. Every platform.

How to Decide

Your hardware and your future plans matter more than benchmarks.

Pick MLX if you own a modern M-series Mac with 32 GB of memory or more, you care only about local performance, and your project will never need to run on a non-Apple machine. The speedup is genuine, and the unified memory integration is elegant.

Pick GGUF if you have 16 GB of RAM or less, if you work across macOS and Linux, or if you are building anything that might one day sit on a server. It is also the better choice if you want the simplest possible setup: one file, one model, no dependency headaches.

Speed is easy to measure with a stopwatch. Portability only becomes visible when it vanishes. Build an MLX-only pipeline for a year, and the day you need to move inference to a CUDA server, you will feel the friction. Keep your project on a MacBook forever, and you will enjoy every frame of the MLX speedup without ever looking back.

The Bottom Line

Personal use on a 32 GB or larger Mac? MLX will give you the best native experience. Working with 16 GB, switching operating systems, or shipping to a server? GGUF is the safer, more flexible bet. If you genuinely cannot decide, default to GGUF. You sacrifice a little speed on Apple Silicon, but you gain the freedom to go anywhere.

Source: MLX vs GGUF on Apple Silicon: Which local LLM format should you actually use?

Want to talk local LLMs with other