Nvidia lanzó Nemotron 3.5 Lightning el 11 de agosto. El modelo de mezcla de expertos (mixture-of-experts) de 30 mil millones de parámetros funciona con solo 3 mil millones de parámetros activos, y su biblioteca de enrutamiento compañera, NeMo Switchyard, ya ha desatado un debate sobre los costes de inferencia y la eficiencia de la caché. La forma en que Switchyard traslada las solicitudes entre modelos puede arruinar las cachés de prompts y, potencialmente, duplicar la factura de una sola sesión de inferencia.

Un modelo diseñado para agentes de pesos abiertos

Nemotron 3.5 Lightning está dirigido a agentes de IA que llaman a herramientas, validan resultados y mantienen un rastro de razonamiento. Tres decisiones técnicas lo distinguen:

  • Arquitectura híbrida – Fusiona un núcleo de espacio de estados Mamba-2 con un Transformer convencional, demostrando que los diseños que no son Transformer pueden competir a esta escala.
  • Cuantización de punto flotante de 4 bits – Al distribuirse en baja precisión, permite que el modelo de 30 B genere aproximadamente 100 tokens por segundo en un MacBook Pro con chip M5 Max, una velocidad que un modelo de precisión completa difícilmente podría igualar.
  • Apertura total – Nvidia publicó los archivos de pesos y la receta de entrenamiento completa, algo poco común para un modelo orientado a la inferencia de alto rendimiento.

Los primeros usuarios dicen que el modelo puede "pensar demasiado", escupiendo largas cadenas de razonamiento que a veces cometen errores. Los desarrolladores obtienen un ejecutor de agentes potente y disponible abiertamente, pero deben redactar los prompts con cuidado para evitar una verbosidad innecesaria.

Por qué es importante la capa de enrutamiento

NeMo Switchyard es la biblioteca de Nvidia para enrutar dinámicamente una solicitud al "mejor" modelo entre un grupo de candidatos. En teoría, un enrutador puede mejorar la calidad de la respuesta al elegir un modelo especialista para cada consulta. En la práctica, la decisión de enrutamiento choca con los mecanismos de almacenamiento en caché de prompts (prompt-caching) en los que confían muchos pipelines de inferencia.

  • Las cachés de prompts almacenan los embeddings de tokens del prompt inicial para que las generaciones posteriores puedan reutilizarlos sin tener que volver a calcular el paso de "prefill".
  • Los cambios de enrutamiento (routing swaps) mueven una solicitud del Modelo A al Modelo B después de los primeros tokens, obligando al sistema a descartar el prompt en caché y volver a calcularlo desde cero para el nuevo modelo.

Dado que la mayor parte del gasto en IA se destina a la lectura del prompt en caché en lugar de a la generación de nuevos tokens, un solo salto de enrutamiento puede, de hecho, duplicar el coste de una solicitud.

El tira y afloja de los costes

Qué hay en el horizonte

El debate surge mientras la estrategia de pesos abiertos de Nvidia se enfrenta a la competencia directa. El 15 de agosto se lanzará Qwen 3.8-27B, y los primeros benchmarks sugieren que puede competir de tú a tú con Nemotron 3.5 Lightning en escenarios de desarrollo local.

El patrón de Nvidia —pesos abiertos, recetas de entrenamiento abiertas y una capa de enrutamiento abierta— parece diseñado para convertir sus GPUs en el hardware predeterminado para cualquiera que ejecute estos modelos localmente. Al exponer el stack de software, Nvidia espera fidelizar a los desarrolladores a su ecosistema, incluso si la lógica de enrutamiento añade penalizaciones de costes ocultas.

Conclusión

Si planeas ejecutar Nemotron 3.5 Lightning en tu propia máquina, no te preguntes solo "¿qué tan rápido puede generar?", sino también "¿con qué frecuencia me obligará Switchyard a descartar mi caché de prompts?". Esa respuesta determinará si la promesa de pesos abiertos del modelo se convierte en un ahorro en el mundo real o en un experimento costoso. A medida que aparezcan alternativas como Qwen, el equilibrio entre la flexibilidad de enrutamiento y la eficiencia de costes basada en la caché decidirá qué conjunto de herramientas —y, en última instancia, qué plataforma de hardware— resultará ganador.