Nemotron 3 Nano 30B A3B, su predecesor, ya se posicionaba como una alternativa compacta a los modelos fundacionales más grandes. Al cambiar a una arquitectura híbrida Mamba-Transformer y activar solo 3.600 millones de parámetros en cualquier momento, Lightning amplía la frontera de la eficiencia sin dejar de ofrecer una capacidad de razonamiento comparable a la de modelos mucho más grandes.

Por qué la velocidad es importante ahora

Los agentes de IA están pasando de la inferencia por lotes a la interacción continua. Un chatbot que se detiene durante varios segundos se siente lento; una herramienta de autocompletado de código que se retrasa respecto a la escritura de un desarrollador interrumpe el flujo de trabajo. En esos entornos, el rendimiento de tokens por segundo se traduce directamente en la capacidad de respuesta percibida. La cifra de 670 tokens por segundo es aproximadamente el doble de los 386 tokens por segundo reportados para Gemini 3.5 Flash-Lite de Google, y reduce el tiempo para completar una tarea estándar del Intelligence Index a unos treinta segundos. En contraste, Qwen 3.6 35B A3B necesita 3,5 minutos y Gemma 4 31B necesita 5,8 minutos para la misma tarea.

Esa brecha es importante para cualquier servicio que deba gestionar múltiples solicitudes simultáneas. Un servidor que procesa el doble de tokens con el mismo hardware puede reducir costes o duplicar la capacidad, una ventaja clara para los proveedores de la nube y las empresas.

Cómo logra el modelo sus cifras

La arquitectura híbrida de Nemotron 3.5 Lightning combina las fortalezas de reconocimiento de patrones de largo alcance de los Transformers con la eficiencia de espacio de estados de los bloques Mamba. El diseño mantiene un recuento total de parámetros elevado —31.600 millones— para conservar la capacidad de modelado, pero solo 3.600 millones están activos para cualquier token dado. La activación dispersa (sparse activation) reduce el cómputo por token, aumentando el rendimiento sin una pérdida proporcional de calidad.

Artificial Analysis midió una puntuación de 24 en el Intelligence Index para Lightning, un salto de nueve puntos respecto a los 15 obtenidos por el anterior modelo Nano. Eso lo sitúa a la par de gpt-oss-120b de OpenAI, a pesar de que Lightning utiliza aproximadamente una cuarta parte de los parámetros. Todavía se queda por detrás de los modelos líderes —Muse Glimmer de Meta (35) y Qwen 3.6 35B A3B (32)—, pero su relación inteligencia-parámetros se sitúa entre las mejores.

Los benchmarks agénticos cuentan una historia similar

Las cargas de trabajo agénticas —planificación, uso de herramientas, razonamiento de múltiples pasos— son donde Lightning brilla. En el benchmark GDPval-AA v2, el modelo obtuvo una puntuación Elo de 824, superando al gpt-oss-120b de 120.000 millones de parámetros (800) y al Nemotron 3 Super de Nvidia, que es más grande (698). En la prueba Terminal-Bench v2.1, la tasa de éxito de Lightning aumentó del 7 % al 24,3 %, acercándose al 26,2 % registrado por gpt-oss-120b.

Nvidia atribuyó la optimización del modelo en tareas específicas de dominio a las colaboraciones de post-entrenamiento con socios como CodeRabbit y Harvey. Esos refinamientos mantienen el modelo rápido mientras sigue siendo competitivo en cargas de trabajo especializadas.

Disponibilidad y consideraciones prácticas

El modelo se distribuye bajo la permisiva licencia OpenMDW-1.1, con pesos en formatos BF16 y NVFP4. La variante NVFP4 comprime el modelo de forma más compacta con una pérdida mínima de calidad, una opción útil para despliegues en el borde (edge) o instancias de la nube que busquen optimizar costes. Una ventana de contexto de un millón de tokens permite al modelo manejar prompts muy largos sin truncamiento, lo cual es valioso para el análisis a nivel de documento o bases de código extensas.

La inferencia sin servidor (serverless) ya está disponible en proveedores como DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius y Crusoe. Los desarrolladores pueden empezar a experimentar sin necesidad de construir una infraestructura personalizada, aunque la verdadera rentabilidad dependerá de los precios de cada plataforma.

Conclusión: Nemotron 3.5 Lightning demuestra que un modelo puede igualar el nivel de razonamiento de sistemas de 120.000 millones de parámetros, ofreciendo casi el doble de rendimiento de tokens que sus principales competidores, lo que lo convierte en un fuerte candidato para agentes de IA sensibles a la latencia.