تحديث Ollama RC: Qwen3.5 وإصلاحات البث (Streaming)

تم إصدار Ollama v0.32.6-rc0. وهو يقدم تحديثات لمستخدمي وحدات معالجة الرسومات (GPU) من Apple ويصلح مشكلات البث (streaming).

ميزات جديدة لمستخدمي Apple: يستخدم محرك MLX الآن رأس MTP لعملية فك التشفير التخميني (speculative decoding) مع Qwen3.5. تتنبأ هذه العملية بالرموز (tokens) مسبقاً، ثم يقوم النموذج الأساسي بالتحقق منها في مجموعات (batches). وهذا يقلل من وقت الانتظار أثناء عملية فك التشفير.

تذكر Ollama أن هذا يجعل Qwen3.5 أسرع. لم يقدموا اختبارات أداء (benchmarks) محددة أو نسباً مئوية للسرعة في الملاحظات. لا تفترض وجود زيادة محددة في السرعة دون إجراء اختباراتك الخاصة.

التوافق مع البث (Streaming Compatibility): يغير التحديث طريقة تعامل نقطة النهاية /v1/chat/completions مع البث. إذا كان برنامجك يعتمد على أجزاء (chunks) محددة أو بيانات finish_reason ، فقم باختباره أولاً. فالسلوك المتوقع لا يقل أهمية عن السرعة في سير عمل الإنتاج.

تحذيرات هامة:

  • هذا إصدار مرشح (release candidate)، وليس نسخة مستقرة.
  • ميزة توليد الصور التجريبية غير متوفرة مؤقتاً.
  • ابقَ على الإصدار 0.32.5 إذا كنت بحاجة إلى توليد الصور.

كيفية المتابعة:

  • اختبر هذا الآن إذا كنت تستخدم وحدة معالجة رسومات من Apple وترغب في أداء أفضل لـ Qwen3.5.
  • انتظر الإصدار المستقر إذا كنت بحاجة إلى توليد الصور أو استقرار عالٍ.
  • قم بقياس سرعات prefill و decode بشكل منفصل. يساعد MTP في عملية الـ decoding ولكنه قد لا يغير زمن الاستجابة (latency) الإجمالي لكل مهمة.

المصدر: https://dev.to/lucioliu/ollamas-latest-rc-improves-qwen35-on-apple-gpus-and-fixes-streaming-compatibility-2gb3

مجتمع تعليمي اختياري: https://t.me/GyaanSetuAi