أطلقت Alibaba نموذج Qwen3.8-Max في 3 أغسطس. وهو نموذج يعتمد على تقنية "خليط من الخبراء" (mixture-of-experts) يتوسع ليصل إلى 2.4 تريليون معلمة (parameter)، لكنه ينشط 95 مليار معلمة فقط أثناء وقت الاستدلال. يقبل النموذج الصور والنصوص عبر بوابة QwenCloud، وتقول Alibaba إن الأوزان ستكون متاحة للجمهور الأسبوع المقبل.

يخفي العنوان البراق سؤالاً أكثر صعوبة: هل يمكن لوكيل النموذج كتابة الكود بشكل موثوق عندما تتعثر الأدوات التي يعتمد عليها؟ تظهر العروض التوضيحية للمورد سباق برمجة ذاتي بالكامل لمدة عشرة أيام بنى مشروعاً من الصفر، لكن تلك التجارب أُجريت على البنية التحتية الخاصة بشركة Alibaba وفي ظل صلاحيات مثالية. يحتاج المطورون في العالم الحقيقي إلى معرفة كيفية تصرف النظام عندما تضغط حدود الرموز (tokens)، أو تفشل استدعاءات الأدوات، أو تتقيد صلاحيات الكتابة.

لماذا يهم هذا الضجيج الإعلامي

تسمح تصميمات "خليط من الخبراء" (Mixture-of-experts) لبحيرة ضخمة من المعلمات بالبقاء خاملة ما لم يتم استدعاء "خبير" محدد، مما يحافظ على تكاليف الاستدلال أقل من النموذج الكثيف (dense model) من نفس الحجم. كما يوسع الإدخال متعدد الوسائط (Multimodal input) حالات الاستخدام إلى ما هو أبعد من مجرد توليد الكود، مما يسمح للمطورين بإدخال الرسوم التخطيطية أو لقطات الشاشة في نفس المطالبة (prompt).

لكن الوعد يعتمد على طبقة الوكيل (agent layer) التي تنسق بين محررات الملفات، والمترجمات (compilers)، ومشغلات الاختبارات، وأوامر التحكم في الإصدار. إذا لم تتمكن هذه الطبقة من التعافي من فشل استدعاء أداة ما، فإن جلسة البرمجة بأكملها ستنهار.

القطعة المفقودة: مقبض جهد الاستدلال

يأتي Qwen3.8-Max مع ثلاثة إعدادات مسبقة لـ "جهد الاستدلال" (reasoning effort): منخفض (low)، ومتوسط (medium)، وعالٍ جداً (xhigh). تضحي هذه الإعدادات بالسرعة مقابل جودة الإجابة، والأهم من ذلك، مقابل عدد الرموز (tokens) التي سيصدرها النموذج.

خطة اختبار قابلة للتكرار

للتأكد من الحقائق بعيداً عن الادعاءات التسويقية، جرب البروتوكول العملي التالي مع ميزانية رموز (token budget) محددة:

  1. أنشئ مستودعاً (repository) جديداً بهيكل "hello world" بسيط بأي لغة.
  2. وجه أمراً للوكيل لإضافة ميزة جديدة (مثل نقطة نهاية REST) وسجل كل خطة يخرجها، وكل استدعاء أداة يقوم به، وكل ملف يلمسه.
  3. قاطع العملية عند أول فشل — على سبيل المثال، عند ظهور خطأ في التجميع (compilation error) — ثم احفظ الحالة الداخلية للنموذج، واستأنف من تلك النقطة.
  4. كرر التشغيل تحت كل إعداد لجهد الاستدلال، مع ملاحظة إجمالي الرموز (tokens)، والوقت الفعلي المستغرق، وأي أخطاء على مستوى الأدوات.
  5. قيد الصلاحيات في جولة واحدة (وصول للقراءة فقط) وامنح صلاحيات كتابة كاملة في جولة أخرى، لترى كيف يتكيف الوكيل.
  6. سجل عمليات إعادة المحاولة: كم مرة يعيد النموذج استدعاء أداة فاشلة مقابل إلغاء العملية؟

يتيح لك جمع هذه المقاييس مقارنة مخرجات البرمجة الخام مقابل التكلفة الخفية لمعالجة الأخطاء. إذا حاول الوكيل مراراً وتكراراً إعادة تشغيل أداة فحص كود (linter) غير مستقرة، فسوف تتضخم فاتورة الرموز (tokens) حتى لو بدا الكود النهائي جيداً.

ما تخفيه الأرقام

رقم 95 مليار معلمة نشطة لا يترجم مباشرة إلى مبلغ مالي. فاستدعاءات الأدوات التي تعيد أخطاءً تجبر النموذج على إنشاء مطالبات تصحيحية، مما يؤدي إلى تضخم استخدام الرموز (tokens). وبدون حالة مستدامة — نقاط تفتيش دورية تسمح لك بالاستئناف بعد الانهيار — يمكن لتكلفة فشل واحد أن تتضاعف بشكل متسلسل.

تنبيه بشأن الأوزان المفتوحة

إن وعد Alibaba بإصدار الأوزان الأسبوع المقبل يفتح الباب للنشر المحلي (on-prem)، ولكن تظل هناك عقبتان عمليتان. أولاً، قد يحد الترخيص من الاستخدام التجاري أو يتطلب الإشارة إلى المصدر؛ لذا يجب على المطورين قراءته قبل دمج النموذج في منتج ما. ثانياً، لا يزال تشغيل نظام "خليط من الخبراء" بـ 2.4 تريليون معلمة يتطلب وحدات معالجة رسومية (GPUs) عالية الأداء أو مسرعات متخصصة. يجب على المتبنين الأوائل التعامل مع ادعاءات "النشر المحلي" على أنها مؤقتة حتى يتم التحقق من متطلبات الأجهزة الفعلية وأرقام الأداء.

وجهة النظر المعارضة: منظور المورد

تظهر الاختبارات الداخلية لشركة Alibaba إكمال النموذج لسباق برمجة ذاتي لمدة عشرة أيام، حيث تعامل مع فرز المشكلات (issue triage)، وتوليد الكود، وتنفيذ الاختبارات دون تدخل بشري. تظهر تلك النتائج ما يريد الفريق منك رؤيته، لكنها لا تثبت الموثوقية في اختبارات العالم الحقيقي.

ما يجب مراقبته لاحقاً

  • نهائية الترخيص: ستحدد الشروط الدقيقة لإصدار الأوزان المفتوحة ما إذا كان بإمكان الشركات الناشئة إطلاق منتجات مدعومة بـ Qwen3.8-Max أو يجب عليها البقاء على واجهة برمجة التطبيقات (API) المستضافة.
  • توفر الأجهزة: إذا بدأ مزودو الخدمات السحابية في تقديم مثيلات (instances) مهيأة مسبقاً لنماذج "خليط من الخبراء"، فإن حاجز الاختبار المحلي سينخفض بشكل كبير.

الخلاصة

إن حجم Qwen3.8-Max الذي يتصدر العناوين وبراعته في تعدد الوسائط ليسا سوى نصف القصة؛ فالمعيار الحقيقي للمطورين هو كيفية إدارة إطار عمل الوكيل الخاص به لفشل الأدوات، وميزانيات الرموز، وحدود الصلاحيات. إن إجراء اختبار منضبط وقابل للتكرار — مع تنويع جهد الاستدلال وحقوق الوصول — سيكشف ما إذا كان النموذج يرتقي إلى مستوى وعوده التسويقية أم أنه يضيف ببساطة طبقة مكلفة أخرى إلى مسار البرمجة.