Actualización de la RC de Ollama: Qwen3.5 y correcciones de streaming

Ollama v0.32.6-rc0 ya está disponible. Trae actualizaciones para usuarios de GPU de Apple y corrige problemas de streaming.

Nuevas funciones para usuarios de Apple: El motor MLX ahora utiliza el cabezal MTP para la decodificación especulativa con Qwen3.5. Este proceso predice los tokens con antelación. El modelo principal los verifica por lotes. Esto reduce el tiempo de espera durante la decodificación.

Ollama afirma que esto hace que Qwen3.5 sea más rápido. No proporcionaron benchmarks específicos ni porcentajes de velocidad en las notas. No asuma un aumento de velocidad específico sin realizar sus propias pruebas.

Compatibilidad de streaming: La actualización cambia la forma en que el endpoint /v1/chat/completions gestiona el streaming. Si su software depende de fragmentos (chunks) específicos o de los datos de finish_reason, pruébelo primero. El comportamiento predecible es tan importante como la velocidad para los flujos de trabajo de producción.

Advertencias importantes:

  • Esta es una versión candidata (release candidate). No es una versión estable.
  • La generación de imágenes experimental ha desaparecido temporalmente.
  • Manténgase en la versión 0.32.5 si necesita generación de imágenes.

Cómo proceder:

  • Pruébelo ahora si utiliza una GPU de Apple y desea un mejor rendimiento de Qwen3.5.
  • Espere a una versión estable si necesita generación de imágenes o una alta estabilidad.
  • Mida las velocidades de prefill y decodificación por separado. El MTP ayuda en la decodificación, pero es posible que no cambie la latencia total para todas las tareas.

Fuente: https://dev.to/lucioliu/ollamas-latest-rc-improves-qwen35-on-apple-gpus-and-fixes-streaming-compatibility-2gb3

Comunidad de aprendizaje opcional: https://t.me/GyaanSetuAi