كشفت شركة Alibaba عن نموذج Qwen3.8-Max، وهو نموذج يعتمد على بنية "خليط الخبراء" (Mixture-of-Experts - MoE) ويحتوي على 2.4 تريليون معلمة (parameter)، حيث حقق نسبة نجاح بلغت 86.1% في اختبار OSWorld-Verified—وتقول Alibaba إن هذه النتيجة تتفوق على GPT-5.6 وSol Max وFable 5. يقيس هذا الاختبار قدرة الذكاء الاصطناعي على التفاعل مع نظام التشغيل، وتثبيت البرامج، وتصحيح الأخطاء البرمجية (debug code)، وهي مجموعة من المهارات التي تشكل الركيزة الأساسية لوكلاء هندسة البرمجيات المستقلين (autonomous software-engineering agents).
السباق نحو الوكلاء المستقلين
انتقلت النماذج اللغوية الكبيرة من كونها مساعدين بأسلوب الدردشة إلى أدوات يمكنها كتابة واختبار وحتى نشر الأكواد البرمجية. الشركات التي يمكنها إسناد الأعمال الهندسية الروتينية إلى الذكاء الاصطناعي بشكل موثوق ستتمكن من خفض تكاليف التوظيف وتسريع دورات تطوير المنتجات. وقد أصبح اختبار OSWorld-Verified معياراً فعلياً للقدرة "الوكيلية" (agentic capability) لأنه يتطلب ما هو أكثر من مجرد توليد نصوص ثابتة؛ فهو يتطلب تفاعلاً حقيقياً مع النظام.
ما يقدمه Qwen3.8-Max
- بنية MoE مع 2.4 تريليون معلمة – يمكن الاستعانة بما يصل إلى 64 شبكة فرعية من الخبراء لكل رمز (token)، وهو تصميم تدعي Alibaba أنه يقلل تكاليف الحوسبة بنسبة 40% تقريباً.
- معالجة الأوامر متعددة الوسائط (Multimodal prompt handling) – يقبل النموذج النصوص والصور والبيانات المهيكلة معاً، مما يسمح لطلب واحد بوصف واجهة مستخدم (UI)، وعرض لقطة شاشة، وتوفير ملفات التكوين.
- نافذة سياق بسعة 64 ألف رمز (token) – مساحة كافية لقواعد الأكواد البرمجية الكاملة، أو ملفات السجلات (log files)، أو التقارير الفنية الطويلة دون الحاجة إلى تقسيمها إلى أجزاء.
تستهدف هذه الميزات سير العمل "من البداية إلى النهاية" (end-to-end) الذي تقضي فرق البرمجيات ساعات في إنجازه: مثل سحب التبعيات (dependencies)، وفحص السجلات، وإصلاح الأخطاء (patching bugs)، وإنشاء الوثائق.
الأرقام تحت المجهر
| المهمة | المقياس المُبلغ عنه |
|---|---|
| OSWorld-Verified (التفاعل الوكيلي مع نظام التشغيل) | نجاح بنسبة 86.1% |
| توليد الأكواد (HumanEval-Plus) | اجتياز بنسبة 78.4% |
| الاستدلال متعدد الوسائط (MM-Bench) | 84.3% |
| تلخيص السياق الطويل (اختبار 50 ألف رمز) | 90.2% |
جميع الأرقام مستمدة من اختبارات Alibaba الداخلية. وإذا ثبتت صحتها، فسيمنح النموذج الشركات واجهة برمجة تطبيقات (API) واحدة يمكنها التعامل مع الأكواد والصور والمستندات الكبيرة، مع الحفاظ على تكاليف استدلال (inference costs) أقل من العديد من المنافسين الذين يستخدمون النماذج الكثيفة (dense-models).
المخاطر والحاجة إلى التحقق المستقل
يعد غياب التحقق من قبل طرف ثالث هو التحذير الأكثر إلحاحاً؛ إذ يمكن ضبط الاختبارات المعيارية، أو تحسين الأوامر، أو تصفية مجموعات الاختبار لصالح بنية معينة. وبدون تكرار النتائج خارجياً، يظل الادعاء بأن Qwen3.8-Max "يتفوق" على GPT-5.6 ادعاءً مؤقتاً. علاوة على ذلك، يمكن أن تظهر نماذج MoE أداءً غير متساوٍ: فقد يتم توجيه بعض الرموز (tokens) إلى خبراء غير مدربين بشكل كافٍ، مما يؤدي إلى حالات "هلوسة" (hallucinations) عرضية أو مخرجات غير متسقة—وهي مشكلات تكتسب أهمية كبرى عندما يُتوقع من الذكاء الاصطناعي تعديل أنظمة الإنتاج.
ما يجب مراقبته لاحقاً
- التكرار المستقل – من المرجح أن يقوم الباحثون وعملاء السحابة بتشغيل نفس مجموعة اختبارات OSWorld-Verified واختبارات HumanEval-Plus على أجهزة متاحة للجمهور.
- التسعير وزمن الاستجابة (latency) – ستكشف أسعار واجهة برمجة التطبيقات (API) من Alibaba Cloud ما إذا كان توفير الحوسبة بنسبة 40% سيترجم إلى ميزة تكلفة ملموسة للمطورين.
- أدوات السلامة – مع اكتساب الوكلاء المستقلين مزيداً من السيطرة على البنية التحتية، سيحتاج النظام البيئي إلى آليات للمراقبة، والتراجع (rollback)، والتدقيق، والتي لا تزال في مراحلها الأولى.
إذا حقق Qwen3.8-Max الأرقام المعلنة، فإن الفجوة بين المساعد الحواري وروبوت الهندسة المكتفي ذاتياً ستتقلص بشكل كبير. ومن المفترض أن تظهر الأشهر القليلة القادمة ما إذا كان أداء النموذج سيصمد أمام الفحص الدقيق، وما إذا كانت الشركات ستعتمده كعمود فقري لخطوط تطوير البرمجيات المؤتمتة الخاصة بها.
