Aggiornamento Ollama RC: Qwen3.5 e correzioni per lo streaming

È disponibile Ollama v0.32.6-rc0. Introduce aggiornamenti per gli utenti di GPU Apple e risolve i problemi relativi allo streaming.

Nuove funzionalità per gli utenti Apple: Il motore MLX ora utilizza l'head MTP per il decoding speculativo con Qwen3.5. Questo processo prevede i token in anticipo. Il modello principale li verifica in batch. Ciò riduce i tempi di attesa durante il decoding.

Ollama afferma che questo rende Qwen3.5 più veloce. Nelle note non sono stati forniti benchmark specifici o percentuali di velocità. Non dare per scontato un aumento specifico della velocità senza effettuare i propri test.

Compatibilità dello streaming: L'aggiornamento modifica il modo in cui l'endpoint /v1/chat/completions gestisce lo streaming. Se il tuo software si affida a chunk specifici o ai dati finish_reason, testalo prima. Un comportamento prevedibile è importante quanto la velocità per i flussi di lavoro in produzione.

Avvisi importanti:

  • Questa è una release candidate. Non è una versione stabile.
  • La generazione sperimentale di immagini è temporaneamente stata rimossa.
  • Rimani alla versione 0.32.5 se hai bisogno della generazione di immagini.

Come procedere:

  • Prova subito se utilizzi una GPU Apple e desideri prestazioni migliori con Qwen3.5.
  • Attendi una release stabile se hai bisogno della generazione di immagini o di un'elevata stabilità.
  • Misura separatamente le velocità di prefill e di decode. MTP aiuta il decoding, ma potrebbe non modificare la latenza totale per ogni task.

Fonte: https://dev.to/lucioliu/ollamas-latest-rc-improves-qwen35-on-apple-gpus-and-fixes-streaming-compatibility-2gb3

Community di apprendimento opzionale: https://t.me/GyaanSetuAi