El framework DSpark de DeepSeek ahora permite que los modelos de lenguaje de gran tamaño (LLM) más comunes generen texto hasta un 85 % más rápido sin necesidad de reentrenamiento ni pérdida de calidad. El aumento de velocidad está disponible hoy mismo a través de la API de DeepSeek y como una biblioteca de código abierto con licencia MIT que cualquiera puede integrar en su propio despliegue.
Por qué la velocidad de inferencia es importante ahora
Para 2026, la mayor parte del presupuesto de computación para la IA se destinará a la inferencia, la fase en la que un modelo entrenado responde a las consultas. A medida que las empresas pasan de construir modelos cada vez más grandes a desplegarlos a escala, la latencia y los costes de hardware se convierten en los factores decisivos. Una inferencia más rápida significa clústeres de GPU más económicos, facturas de la nube más bajas y experiencias de usuario más ágiles.
El truco de la decodificación especulativa
La generación tradicional avanza token por token: el modelo predice la siguiente palabra, luego la siguiente, y así sucesivamente. Ese avance secuencial ralentiza las GPU modernas, cuya fortaleza es el paralelismo. DSpark evita este cuello de botella mediante la decodificación especulativa:
- Un modelo de "borrador" (draft) ligero predice varios tokens por adelantado.
- El modelo principal, mucho más grande, valida esas predicciones en un único lote (batch).
- Cuando las conjeturas del borrador coinciden con las expectativas del modelo grande, el sistema emite todo el lote a la vez, reduciendo el tiempo de espera por token.
- Si una conjetura es incorrecta, el lote se rechaza y el proceso se repite, asegurando que el resultado final coincida con lo que el modelo grande habría producido por sí solo.
Debido a que el modelo grande sigue realizando la comprobación final, el texto generado mantiene exactamente la misma calidad y precisión que una ejecución pura de un solo token.
Lo que DSpark admite hoy
- Código abierto bajo la permisiva licencia MIT, para que los equipos puedan auditarlo, modificarlo o integrarlo sin obstáculos de licencias.
- Compatibilidad con DeepSeek, Qwen de Alibaba y Gemma de Google, cubriendo una gama de familias de LLM de código abierto muy populares.
- Ganancias de velocidad inmediatas en el hardware existente; los usuarios reportan una inferencia entre un 60 % y un 85 % más rápida, lo que se traduce en menos horas de GPU para la misma carga de trabajo.
- Menor presión para actualizar a GPUs más nuevas y costosas, un factor clave de costes tanto para startups como para empresas.
Si ya utiliza la API alojada de DeepSeek, las optimizaciones de DSpark se ejecutan de forma transparente. Para despliegues locales (on-premise), el código base de DeepSpec en GitHub proporciona la infraestructura de modelo de borrador que necesita para montar su propio pipeline especulativo.
Conclusión
DSpark demuestra que un ajuste puramente de software puede lograr reducciones de latencia que antes se pensaba que requerían hardware más nuevo. Al poner la decodificación especulativa a disposición de todos, DeepSeek traslada la batalla de la eficiencia de la IA de los "chips más grandes" al "código más inteligente", dando a cualquiera que pueda ejecutar un modelo grande la oportunidad de hacerlo de forma más rápida y económica.
