Un modelo Mixture-of-Experts de 150 mil millones de parámetros puede generar texto en un portátil de desarrollo estándar. El experimento demuestra que la RAM, y no la velocidad del SSD, es el verdadero limitador del rendimiento. Esto es importante porque demuestra que los modelos de escala de vanguardia se pueden probar localmente sin gastar en computación en la nube.

La prueba

Ejecutamos el modelo DeepSeek V4 Flash —un MoE de 150 mil millones de parámetros con poda REAP— a través del motor de inferencia de código abierto Colibrì. El hardware fue un portátil AMD Ryzen AI 9 365 con 61 GB de RAM y un SSD NVMe de 1 TB. Cronometramos una ejecución de generación de tres minutos y registramos cada acceso al disco.

Lo que revelan los números

  • La actividad del disco fue mínima. El SSD realizó menos de 11 segundos de lectura durante la generación de tres minutos. Incluso si la unidad pudiera leer datos instantáneamente, el rendimiento total mejoraría solo alrededor de un 6 por ciento.
  • El tamaño de la RAM impactó directamente en la velocidad. Reducir a la mitad la caché de la RAM disminuyó el rendimiento en aproximadamente un 15 por ciento. La CPU pasó casi tanto tiempo gestionando fallos de caché —descuantizando, copiando y gestionando datos— como esperando al disco.

Estas cifras desmienten la creencia común de que el ancho de banda de almacenamiento es el principal cuello de botella para la inferencia de modelos grandes en un portátil.

Por qué la RAM supera al SSD

Cuando un parámetro del modelo no reside ya en la RAM, el sistema debe:

  1. Extraer los datos del SSD.
  2. Decodificarlos y moverlos a los registros de la CPU para su computación.

Ambos pasos consumen ciclos. El primer paso está limitado por el ancho de banda del SSD; el segundo añade aproximadamente el mismo retraso porque la CPU debe descuantizar los datos independientemente de la rapidez con la que lleguen. Por lo tanto, un SSD más rápido ofrece rendimientos decrecientes, mientras que más RAM permite que una mayor parte del modelo permanezca residente y elimina el costoso viaje de ida y vuelta.

Implicaciones para los desarrolladores

  • Invierta en memoria, no en almacenamiento.
  • Las pruebas locales se vuelven viables. Los desarrolladores pueden ejecutar modelos MoE de pesos abiertos en máquinas existentes, comprobando el estilo, el comportamiento de llamada a herramientas (tool-calling) y la calidad de la salida sin pagar créditos en la nube.
  • La evaluación por lotes es realista. El chat en tiempo real puede seguir sintiéndose lento, pero los trabajos en cola —generar docenas de prompts para investigación— se ejecutan cómodamente en un portátil.

Posible contraargumento

Algunos podrían argumentar que la latencia del SSD sigue siendo importante para las cargas de trabajo que cargan repetidamente nuevos pesos de expertos.

Qué observar a continuación

  • Variantes de modelos eficientes en memoria.
  • Hardware con cachés integradas más grandes.
  • Estrategias de caché a nivel de software.

La conclusión es clara: los desarrolladores que quieran experimentar con modelos MoE masivos en un portátil deberían comprar más RAM. Las actualizaciones de SSD solo reducen unos pocos puntos porcentuales, mientras que la memoria adicional puede recortar el tiempo de inferencia en porcentajes de dos dígitos. Esto cambia el cálculo de costes para el prototipado de IA y abre la puerta a pruebas locales y gratuitas de modelos que antes se pensaba que requerían clústeres de nube dedicados.