Si ejecutas modelos de lenguaje de gran tamaño localmente en un Mac, probablemente te hayas quedado mirando una página de descarga preguntándote por qué hay dos carpetas diferentes para lo que parece ser el mismo modelo. Una termina en .gguf y se presenta como un único y pesado archivo. La otra es un directorio MLX lleno de archivos de pesos, un tokenizador y algo de configuración JSON. Ambas afirman ejecutarse de manera eficiente en Apple Silicon. Solo una de ellas se queda realmente dentro del jardín de Apple.
Esto no es solo una diferencia de empaquetado. La elección entre MLX y GGUF determina qué tan rápido se ejecuta tu modelo, cuánta memoria consume y si tu proyecto podrá alguna vez salir de tu portátil.
Qué es realmente GGUF
GGUF surgió del ecosistema llama.cpp. Es un formato de contenedor binario que agrupa los pesos del modelo, el vocabulario del tokenizador, metadatos e hiperparámetros en un único archivo autónomo. Puedes tomar un solo archivo cuantizado, soltarlo en una carpeta y ejecutarlo en casi cualquier máquina que tenga un cargador compatible. Eso significa Metal en macOS, CUDA en Linux o Windows, e incluso backends de Vulkan o solo de CPU si no hay una GPU disponible.
La verdadera ventaja aquí es la portabilidad. Como todo reside en un solo archivo, GGUF viaja bien. Puedes moverlo de tu MacBook a un servidor Linux sin tener que volver a descargar nada. Puedes archivarlo en un NAS y saber que, dentro de un año, un solo comando lo cargará. Para equipos que mezclan hardware, o para cualquiera que esté construyendo infraestructura que eventualmente podría desplegarse en un centro de datos, esta ubicuidad es difícil de superar.
GGUF también hereda años de cuidadosa investigación en cuantización de la comunidad llama.cpp. Los esquemas de precisión mixta como Q4_K_M y Q5_K_M fueron ajustados para preservar la calidad con anchos de bits muy bajos. Ese legado es importante cuando intentas comprimir un modelo de 70 mil millones de parámetros en 40 gigabytes de espacio en disco.
Lo que MLX aporta a la mesa
MLX no es solo un formato de archivo. Es un framework de arrays desarrollado por Apple, diseñado específicamente para el aprendizaje automático en chips de la serie M. Un modelo MLX es típicamente un directorio de archivos en lugar de un único bloque. El framework se comunica directamente con el backend de Metal y trata la memoria de la CPU y la GPU como un pool unificado. En Apple Silicon, la CPU y la GPU comparten los mismos chips de memoria física, por lo que MLX evita la costosa copia de datos que ocurre tradicionalmente cuando la información se traslada entre el procesador y la tarjeta gráfica.
El inconveniente es obvio: MLX no funciona en Windows. No funciona en Linux. No funciona en máquinas con CUDA. Si tu flujo de trabajo alguna vez sale del ecosistema Apple, necesitarás convertir o volver a descargar el modelo en un formato diferente.
Para desarrolladores independientes que viven enteramente en un Mac Studio o MacBook Pro, esa limitación podría no significar nada. Para cualquier otra persona, es un muro.
Dónde se sitúa el rendimiento
En Apple Silicon, MLX suele ser la opción más rápida. Los benchmarks muestran que se ejecuta entre un 15 y un 40 por ciento más rápido que GGUF cargado a través de un motor con soporte para Metal en el mismo Mac. En la práctica, esa brecha convierte una respuesta de streaming lenta de 20 segundos en una ágil de 12 segundos. Durante una larga sesión de programación o un flujo de trabajo de escritura extendido, esos segundos se acumulan en una experiencia notablemente más fluida.
El uso de memoria sigue un patrón similar. MLX tiende a consumir aproximadamente un 10 por ciento menos de RAM que un modelo GGUF equivalente. Ese ahorro proviene de la arquitectura de memoria unificada y de la ausencia de copias de búfer adicionales. En una máquina con 64 GB de RAM, un 10 por ciento es un margen de maniobra cómodo. En un Mac de 32 GB, puede ser la diferencia entre alojar cómodamente un modelo de 13B o tener que recurrir al swap.
Sin embargo, hay una compensación en la calidad. Con una cuantización de 4 bits, un archivo GGUF bien ajustado que utilice el método Q4_K_M mantiene una fidelidad de salida ligeramente mejor que una conversión típica de MLX a 4 bits. Los trucos de precisión mixta en GGUF se refinaron a través de miles de pruebas de usuarios. Si tu tarea implica un razonamiento preciso, sintaxis de código o un seguimiento de instrucciones matizado, ese pequeño delta en la calidad podría importar más que el rendimiento bruto.
Escenarios reales, decisiones reales
Imagina que eres un desarrollador con un MacBook M3 Pro y 36 GB de memoria unificada. Ejecutas un asistente de programación local dentro de VS Code todo el día. Nunca tocas una máquina con Windows. MLX tiene sentido aquí. La velocidad adicional hace que el autocompletado se sienta instantáneo, y el ahorro de memoria te permite mantener un navegador con cincuenta pestañas abiertas sin asfixiar el sistema.
Imagine ahora a un investigador con un MacBook Air M1 básico de 16 GB de RAM. Ocasionalmente, necesita ejecutar el mismo cuaderno de análisis en un servidor Linux departamental con tarjetas NVIDIA. GGUF es la opción obvia. El archivo único simplifica las copias de seguridad, y la cuantización de precisión mixta extrae la mejor calidad posible de una memoria limitada. Cuando se conectan por SSH al servidor, pueden ejecutar exactamente los mismos pesos sin conversión de formato.
O considere una pequeña startup que desarrolla una herramienta de IA de escritorio. Prototipan en Macs, pero saben que sus clientes utilizan una mezcla de portátiles Windows y estaciones de trabajo Linux. Apostar por MLX demasiado pronto los dejaría acorralados. GGUF mantiene abiertas sus opciones de despliegue. Un archivo. Un pipeline. Todas las plataformas.
Cómo decidir
Su hardware y sus planes futuros importan más que los benchmarks.
Elija MLX si posee un Mac moderno de la serie M con 32 GB de memoria o más, si solo le importa el rendimiento local y si su proyecto nunca necesitará ejecutarse en una máquina que no sea Apple. La mejora de velocidad es real y la integración de la memoria unificada es elegante.
Elija GGUF si tiene 16 GB de RAM o menos, si trabaja entre macOS y Linux, o si está construyendo algo que algún día podría alojarse en un servidor. También es la mejor opción si busca la configuración más sencilla posible: un archivo, un modelo, sin dolores de cabeza por las dependencias.
La velocidad es fácil de medir con un cronómetro. La portabilidad solo se hace visible cuando desaparece. Construya un pipeline exclusivo para MLX durante un año y, el día que necesite trasladar la inferencia a un servidor CUDA, sentirá la fricción. Mantenga su proyecto en un MacBook para siempre y disfrutará de cada instante de la aceleración de MLX sin mirar atrás.
En resumen
¿Uso personal en un Mac de 32 GB o más? MLX le ofrecerá la mejor experiencia nativa. ¿Trabaja con 16 GB, cambia de sistema operativo o despliega en un servidor? GGUF es la apuesta más segura y flexible. Si realmente no puede decidirse, elija GGUF por defecto. Sacrificará un poco de velocidad en Apple Silicon, pero ganará la libertad de ir a cualquier parte.
Fuente: MLX vs GGUF on Apple Silicon: Which local LLM format should you actually use?
¿Quiere hablar de LLM locales con otros...
