Aggiornamento Ollama RC: Qwen3.5 e correzioni per lo streaming
È disponibile Ollama v0.32.6-rc0. Introduce aggiornamenti per gli utenti di GPU Apple e risolve i problemi relativi allo streaming.
Nuove funzionalità per gli utenti Apple: Il motore MLX ora utilizza l'head MTP per il decoding speculativo con Qwen3.5. Questo processo prevede i token in anticipo. Il modello principale li verifica in batch. Ciò riduce i tempi di attesa durante il decoding.
Ollama afferma che questo rende Qwen3.5 più veloce. Nelle note non sono stati forniti benchmark specifici o percentuali di velocità. Non dare per scontato un aumento specifico della velocità senza effettuare i propri test.
Compatibilità dello streaming: L'aggiornamento modifica il modo in cui l'endpoint /v1/chat/completions gestisce lo streaming. Se il tuo software si affida a chunk specifici o ai dati finish_reason, testalo prima. Un comportamento prevedibile è importante quanto la velocità per i flussi di lavoro in produzione.
Avvisi importanti:
- Questa è una release candidate. Non è una versione stabile.
- La generazione sperimentale di immagini è temporaneamente stata rimossa.
- Rimani alla versione 0.32.5 se hai bisogno della generazione di immagini.
Come procedere:
- Prova subito se utilizzi una GPU Apple e desideri prestazioni migliori con Qwen3.5.
- Attendi una release stabile se hai bisogno della generazione di immagini o di un'elevata stabilità.
- Misura separatamente le velocità di prefill e di decode. MTP aiuta il decoding, ma potrebbe non modificare la latenza totale per ogni task.
Community di apprendimento opzionale: https://t.me/GyaanSetuAi
