DeepMind presentó esta semana DiffusionGemma, un modelo de lenguaje de pesos abiertos que puede generar aproximadamente 1.500 tokens por segundo en una sola GPU H100, mientras que el modelo estándar Gemma 4 alcanza un máximo de cerca de 303 tokens por segundo. Este aumento de velocidad es importante porque podría reducir el cuello de botella de latencia que ralentiza a los agentes impulsados por IA en aplicaciones en tiempo real.
Cómo DiffusionGemma rompe el hábito de token por token
La mayoría de los modelos de lenguaje modernos generan texto de forma autorregresiva: predicen un token, lo reintroducen en el modelo y luego predicen el siguiente. Ese bucle de "izquierda a derecha" impone un acoplamiento estrecho entre el cómputo y la memoria, ya que se debe acceder a los pesos del modelo para cada token individual. DiffusionGemma sustituye este bucle por un proceso de difusión discreta que trata un bloque de 256 tokens como una única unidad de datos con ruido. El modelo entonces elimina el ruido de todo el bloque en paralelo, desplazando la carga de trabajo de las búsquedas repetidas de pesos hacia una mayor cantidad de cómputo por paso. En hardware que destaca en matemáticas paralelas, como la H100 de Nvidia, esta compensación resulta beneficiosa.
Por qué la velocidad es importante para los agentes de IA
Los agentes autónomos suelen ejecutar un ciclo de búsqueda, resumen y prueba. Cada paso puede implicar varias llamadas al modelo, por lo que cualquier latencia por token se acumula rápidamente. Cuando un modelo se detiene, todo el flujo de trabajo del agente se congestiona, lo que aumenta los costes y degrada la experiencia del usuario.
La compensación de rendimiento
La velocidad de DiffusionGemma conlleva un coste mensurable en cuanto a capacidad bruta. En el benchmark AIME —una suite que mide el razonamiento, la veracidad y la comprensión del lenguaje— DiffusionGemma obtiene una puntuación de 69,1, mientras que Gemma 4 alcanza 88,3. El enfoque de difusión también muestra debilidades con salidas muy cortas y un ocasional "tartamudeo" de tokens, donde el texto generado se repite o vacila. Cuando más de unos 32 usuarios consultan el modelo de forma concurrente, la ventaja del procesamiento paralelo se erosiona y el método autorregresivo estándar alcanza el mismo rendimiento general.
Dónde encaja cada enfoque
Los datos sugieren una estrategia de despliegue híbrida:
- Modelos de difusión para tareas de baja concurrencia y sensibles a la latencia que no exijan un razonamiento profundo; por ejemplo, generar prompts cortos, completar plantillas o producir borradores de texto.
- Modelos autorregresivos para cargas de trabajo de alta concurrencia, razonamiento complejo o generación de textos largos donde la precisión es más importante que la velocidad bruta.
Lo que este cambio implica para la infraestructura de IA
Si las ganancias de velocidad pueden obtenerse repensando el algoritmo de generación en lugar de simplemente escalar el tamaño del modelo, las mayores victorias en eficiencia podrían provenir de mejoras en la infraestructura subyacente. La compensación también significa que los desarrolladores deben aceptar una ligera disminución en la calidad para ciertos casos de uso.
Contrapunto: ¿está la difusión lista para el uso general?
La implementación de la difusión tiene dificultades con los prompts cortos y puede producir resultados inestables.
Qué observar a continuación
- Estudios de escalabilidad: ¿Lograrán los modelos de difusión más grandes cerrar la brecha de capacidad manteniendo la velocidad?
- Optimizaciones de hardware: A medida que las GPUs evolucionen, el equilibrio entre los pasos de difusión con gran carga de cómputo y la autorregresión con gran carga de pesos podría cambiar de nuevo.
- Algoritmos de enrutamiento: Los primeros prototipos de enrutadores de modelos conscientes de la tarea revelarán cuánto se puede reducir la latencia total del sistema mediante la selección dinámica.
Conclusión
DiffusionGemma demuestra que repensar el bucle de generación fundamental puede reducir drásticamente la latencia sin necesidad de añadir más chips. Esta tecnología no es un reemplazo total para los modelos autorregresivos, pero ofrece una herramienta potente para una pila de IA híbrida donde la velocidad y la precisión se equilibran según la tarea. Es probable que la próxima ola de infraestructura de IA no se juzgue solo por el tamaño del modelo, sino por la inteligencia con la que enruta el trabajo a través del tipo de motor adecuado.
