Ollama RC Update: Qwen3.5 மற்றும் Streaming சரிசெய்தல்கள்

Ollama v0.32.6-rc0 வெளியாகிவிட்டது. இது Apple GPU பயனர்களுக்கான அப்டேட்களையும், streaming சிக்கல்களுக்கான தீர்வுகளையும் கொண்டுவருகிறது.

Apple பயனர்களுக்கான புதிய அம்சங்கள்:

MLX engine இப்போது Qwen3.5 உடன் speculative decoding செய்ய MTP head-ஐப் பயன்படுத்துகிறது. இந்த செயல்முறை டோக்கன்களை (tokens) முன்கூட்டியே கணிக்கும். முக்கிய மாடல் அவற்றை தொகுதிகளாக (batches) சரிபார்க்கும். இது decoding செய்யும்போது காத்திருக்கும் நேரத்தைக் குறைக்கிறது.

இது Qwen3.5-ஐ வேகமாக்குவதாக Ollama கூறுகிறது. அவர்கள் குறிப்புகளில் குறிப்பிட்ட benchmarks அல்லது வேக சதவீதங்களை வழங்கவில்லை. உங்கள் சொந்த சோதனைகள் இன்றி குறிப்பிட்ட வேக அதிகரிப்பைத் தீர்மானிக்க வேண்டாம்.

Streaming இணக்கத்தன்மை:

இந்த அப்டேட் /v1/chat/completions endpoint எவ்வாறு streaming-ஐக் கையாள்கிறது என்பதை மாற்றுகிறது. உங்கள் மென்பொருள் குறிப்பிட்ட chunks அல்லது finish_reason தரவுகளைச் சார்ந்து இருந்தால், முதலில் அதைச் சோதித்துப் பார்க்கவும். உற்பத்திப் பணிகளுக்கு (production workflows) வேகத்தைப் போலவே கணிக்கக்கூடிய செயல்பாடும் (predictable behavior) முக்கியமானது.

முக்கியமான எச்சரிக்கைகள்:

  • இது ஒரு release candidate. இது நிலையான (stable) பதிப்பல்ல.
  • சோதனை ரீதியிலான பட உருவாக்கம் (experimental image generation) தற்காலிகமாக நீக்கப்பட்டுள்ளது.
  • உங்களுக்குப் பட உருவாக்கம் தேவைப்பட்டால், பதிப்பு 0.32.5-லேயே தொடரவும்.

எவ்வாறு தொடங்குவது:

  • நீங்கள் Apple GPU பயன்படுத்துபவர் மற்றும் சிறந்த Qwen3.5 செயல்திறனை விரும்பினால், இப்போதே இதைச் சோதித்துப் பார்க்கவும்.
  • உங்களுக்குப் பட உருவாக்கம் அல்லது அதிக நிலைத்தன்மை தேவைப்பட்டால், நிலையான பதிப்பிற்காக (stable release) காத்திருக்கவும்.
  • prefill மற்றும் decode வேகங்களைத் தனித்தனியாக அளவிடவும். MTP decoding-க்கு உதவுகிறது, ஆனால் ஒவ்வொரு பணிக்கும் மொத்த தாமதத்தை (total latency) மாற்றாது.

ஆதாரம்: https://dev.to/lucioliu/ollamas-latest-rc-improves-qwen35-on-apple-gpus-and-fixes-streaming-compatibility-2gb3

விருப்பமான கற்றல் சமூகம்: https://t.me/GyaanSetuAi