Macでローカルに大規模言語モデル(LLM)を実行しているなら、ダウンロードページを見つめながら、なぜ同じように見えるモデルに対して2つの異なるフォルダが存在するのかと疑問に思ったことがあるでしょう。一方は.ggufで終わり、単一の巨大なファイルとして存在しています。もう一方は、重みファイル、トークナイザー、いくつかのJSON設定ファイルが詰め込まれたMLXディレクトリです。どちらもApple Silicon上で効率的に動作すると謳っていますが、実際にAppleのエコシステム内に留まるのは片方だけです。

これは単なるパッケージングの違いではありません。MLXとGGUFのどちらを選ぶかは、モデルの実行速度、メモリ消費量、そしてプロジェクトがあなたのノートPCを離れて展開できるかどうかに影響を与えます。

GGUFとは一体何か

GGUFはllama.cppのエコシステムから生まれました。これは、モデルの重み、トークナイザーの語彙、メタデータ、ハイパーパラメータを一つの自己完結したファイルにまとめたバイナリコンテナ形式です。単一の量子化ファイルをダウンロードしてフォルダに放り込むだけで、互換性のあるローダーを備えたほぼすべてのマシンで実行できます。つまり、macOS上のMetal、LinuxやWindows上のCUDA、さらにはGPUが利用できない場合のVulkanやCPUのみのバックエンドでも動作することを意味します。

ここでの真の利点は、ポータビリティ(移植性)です。すべてが1つのファイルに収まっているため、GGUFの持ち運びは容易です。再ダウンロードすることなく、MacBookからLinuxサーバーへ移動できます。NASにアーカイブしておけば、1年後でもコマンド一つでロードできることが保証されます。ハードウェアを混在させているチームや、最終的にデータセンターへデプロイする可能性のあるインフラを構築している人にとって、この汎用性は非常に強力です。

また、GGUFはllama.cppコミュニティによる長年の入念な量子化研究の成果を受け継いでいます。Q4_K_MQ5_K_Mのような混合精度スキームは、非常に低いビット幅でも品質を維持するように調整されています。700億パラメータのモデルを40GBのディスクスペースに押し込むような場合、その実績は重要になります。

MLXがもたらすもの

MLXは単なるファイル形式ではありません。Mシリーズチップ上での機械学習に特化して設計された、Apple製の配列フレームワークです。MLXモデルは通常、単一の塊ではなく、ファイルが格納されたディレクトリ形式をとります。このフレームワークはMetalバックエンドと直接通信し、CPUとGPUのメモリを一つの統合されたプールとして扱います。Apple Siliconでは、CPUとGPUが同じ物理メモリチップを共有しているため、MLXはプロセッサとグラフィックスカードの間でデータがやり取りされる際に従来発生していた高コストなコピー処理を回避できます。

欠点は明白です。MLXはWindowsでは動作しません。Linuxでも、CUDAマシンでも動作しません。ワークフローがAppleのエコシステムから外れることがあれば、モデルを別の形式に変換するか、再ダウンロードする必要があります。

Mac StudioやMacBook Proだけで完結している個人開発者にとって、その制限は問題にならないかもしれません。しかし、それ以外の人にとっては、それは大きな壁となります。

パフォーマンスの差

Apple Siliconにおいては、通常MLXの方が高速な選択肢となります。ベンチマークでは、同じMac上でMetalバックエンドのエンジンを介してロードされたGGUFよりも、MLXの方が15%から40%高速に動作することが示されています。実際には、その差によって、20秒かかる鈍いストリーミングレスポンスが、12秒のキビキビとしたレスポンスに変わります。長時間のコーディングセッションや執筆ワークフローにおいて、それらの数秒の積み重ねが、明らかにスムーズな体験へとつながります。

メモリ使用量も同様の傾向があります。MLXは、同等のGGUFモデルよりもRAM消費量が約10%少ない傾向にあります。その節約は、ユニファイドメモリ・アーキテクチャと、余分なバッファコピーが発生しないことによるものです。64GBのRAMを搭載したマシンでは、10%の差は余裕のあるマージンとなります。32GBのMacでは、13Bモデルを快適に収めるか、スワップが発生するかどうかの分かれ目になり得ます。

ただし、品質面でのトレードオフがあります。4ビット量子化において、Q4_K_Mメソッドを使用した適切に調整されたGGUFファイルは、一般的な4ビットのMLX変換よりも、わずかに優れた出力忠実度を維持します。GGUFの混合精度テクニックは、数千ものユーザーテストを通じて洗練されてきました。もしあなたのタスクが、精密な推論、コーディングの構文、あるいは微妙な指示への追従を必要とするものであれば、そのわずかな品質の差が、生の処理能力よりも重要になるかもしれません。

実践的なシナリオと選択

例えば、あなたがM3 Pro MacBookと36GBのユニファイドメモリを持つ開発者だと想像してください。一日中VS Code内でローカルのコーディングアシスタントを実行しており、Windowsマシンには一切触れません。この場合、MLXが理にかなっています。追加のスピードによってオートコンプリートが瞬時に感じられ、メモリの節約によって、システムを圧迫することなく50個のタブを開いたブラウザを使い続けることができます。

Now picture a researcher on a base M1 MacBook Air with 16 GB of RAM. They occasionally need to run the same analysis notebook on a departmental Linux server with NVIDIA cards. GGUF is the obvious pick. The single file simplifies backups, and the mixed-precision quantization wrings the best possible quality out of limited memory. When they SSH into the server, they can run the exact same weights without format conversion.

Or consider a small startup building a desktop AI tool. They prototype on Macs but know their customers use a mix of Windows laptops and Linux workstations. Betting on MLX early would paint them into a corner. GGUF keeps their deployment options open. One file. One pipeline. Every platform.

How to Decide

Your hardware and your future plans matter more than benchmarks.

Pick MLX if you own a modern M-series Mac with 32 GB of memory or more, you care only about local performance, and your project will never need to run on a non-Apple machine. The speedup is genuine, and the unified memory integration is elegant.

Pick GGUF if you have 16 GB of RAM or less, if you work across macOS and Linux, or if you are building anything that might one day sit on a server. It is also the better choice if you want the simplest possible setup: one file, one model, no dependency headaches.

Speed is easy to measure with a stopwatch. Portability only becomes visible when it vanishes. Build an MLX-only pipeline for a year, and the day you need to move inference to a CUDA server, you will feel the friction. Keep your project on a MacBook forever, and you will enjoy every frame of the MLX speedup without ever looking back.

The Bottom Line

Personal use on a 32 GB or larger Mac? MLX will give you the best native experience. Working with 16 GB, switching operating systems, or shipping to a server? GGUF is the safer, more flexible bet. If you genuinely cannot decide, default to GGUF. You sacrifice a little speed on Apple Silicon, but you gain the freedom to go anywhere.

Source: MLX vs GGUF on Apple Silicon: Which local LLM format should you actually use?

Want to talk local LLMs with other