Ollama RC Update: Qwen3.5 மற்றும் Streaming சரிசெய்தல்கள்
Ollama v0.32.6-rc0 வெளியாகிவிட்டது. இது Apple GPU பயனர்களுக்கான அப்டேட்களையும், streaming சிக்கல்களுக்கான தீர்வுகளையும் கொண்டுவருகிறது.
Apple பயனர்களுக்கான புதிய அம்சங்கள்:
MLX engine இப்போது Qwen3.5 உடன் speculative decoding செய்ய MTP head-ஐப் பயன்படுத்துகிறது. இந்த செயல்முறை டோக்கன்களை (tokens) முன்கூட்டியே கணிக்கும். முக்கிய மாடல் அவற்றை தொகுதிகளாக (batches) சரிபார்க்கும். இது decoding செய்யும்போது காத்திருக்கும் நேரத்தைக் குறைக்கிறது.
இது Qwen3.5-ஐ வேகமாக்குவதாக Ollama கூறுகிறது. அவர்கள் குறிப்புகளில் குறிப்பிட்ட benchmarks அல்லது வேக சதவீதங்களை வழங்கவில்லை. உங்கள் சொந்த சோதனைகள் இன்றி குறிப்பிட்ட வேக அதிகரிப்பைத் தீர்மானிக்க வேண்டாம்.
Streaming இணக்கத்தன்மை:
இந்த அப்டேட் /v1/chat/completions endpoint எவ்வாறு streaming-ஐக் கையாள்கிறது என்பதை மாற்றுகிறது. உங்கள் மென்பொருள் குறிப்பிட்ட chunks அல்லது finish_reason தரவுகளைச் சார்ந்து இருந்தால், முதலில் அதைச் சோதித்துப் பார்க்கவும். உற்பத்திப் பணிகளுக்கு (production workflows) வேகத்தைப் போலவே கணிக்கக்கூடிய செயல்பாடும் (predictable behavior) முக்கியமானது.
முக்கியமான எச்சரிக்கைகள்:
- இது ஒரு release candidate. இது நிலையான (stable) பதிப்பல்ல.
- சோதனை ரீதியிலான பட உருவாக்கம் (experimental image generation) தற்காலிகமாக நீக்கப்பட்டுள்ளது.
- உங்களுக்குப் பட உருவாக்கம் தேவைப்பட்டால், பதிப்பு 0.32.5-லேயே தொடரவும்.
எவ்வாறு தொடங்குவது:
- நீங்கள் Apple GPU பயன்படுத்துபவர் மற்றும் சிறந்த Qwen3.5 செயல்திறனை விரும்பினால், இப்போதே இதைச் சோதித்துப் பார்க்கவும்.
- உங்களுக்குப் பட உருவாக்கம் அல்லது அதிக நிலைத்தன்மை தேவைப்பட்டால், நிலையான பதிப்பிற்காக (stable release) காத்திருக்கவும்.
- prefill மற்றும் decode வேகங்களைத் தனித்தனியாக அளவிடவும். MTP decoding-க்கு உதவுகிறது, ஆனால் ஒவ்வொரு பணிக்கும் மொத்த தாமதத்தை (total latency) மாற்றாது.
விருப்பமான கற்றல் சமூகம்: https://t.me/GyaanSetuAi
