Ollama RC Update: Qwen3.5 and Streaming Fixes
Ollama v0.32.6-rc0 imetoka. Inaleta sasisho kwa watumiaji wa Apple GPU na kurekebisha matatizo ya streaming.
New Features for Apple Users: Injini ya MLX sasa inatumia kichwa cha MTP kwa ajili ya speculative decoding na Qwen3.5. Mchakato huu unatabiri tokeni mapema. Modeli kuu inazihakiki kwa makundi (batches). Hii inapunguza muda wa kusubiri wakati wa decoding.
Ollama inasema kuwa hii inafanya Qwen3.5 kuwa ya haraka zaidi. Hawakutoa vipimo maalum (benchmarks) au asilimia za kasi kwenye maelezo yao. Usichukulie kuwa kuna ongezeko la kasi fulani bila kufanya majaribio yako mwenyewe.
Streaming Compatibility: Sasisho hili linabadilisha jinsi endpoint ya /v1/chat/completions inavyoshughulikia streaming. Ikiwa programu yako inategemea vipande (chunks) maalum au data ya finish_reason, ijaribu kwanza. Tabia inayotabirika ni muhimu kama vile kasi kwa mifumo ya uzalishaji (production workflows).
Important Warnings:
- Hii ni release candidate. Si toleo la utulivu (stable version).
- Uundaji wa picha wa majaribio (experimental image generation) umesitishwa kwa muda.
- Endelea kutumia toleo la 0.32.5 ikiwa unahitaji uundaji wa picha.
How to proceed:
- Ijaribu hii sasa ikiwa unatumia Apple GPU na unataka utendaji bora wa Qwen3.5.
- Subiri toleo la utulivu (stable release) ikiwa unahitaji uundaji wa picha au utulivu wa hali ya juu.
- Pima kasi za prefill na decode kando kando. MTP inasaidia decoding lakini inaweza isiweze kubadilisha latency ya jumla kwa kila kazi.
Optional learning community: https://t.me/GyaanSetuAi
