أطلقت Microsoft نموذج MAI Code 1.1 Flash كجيل جديد من نماذج البرمجة لـ GitHub Copilot، لكن نتائج الاختبارات المرجعية (benchmarks) وجداول الأسعار الأولية تضعه خلف عرض DeepSeek مفتوح الأوزان (open-weight) من حيث الأداء والتكلفة على حد سواء.
واقع الاختبارات المرجعية مقابل البيان الصحفي
تعد ملاحظات إطلاق Microsoft بزيادة قدرها 25% في كفاءة الرموز (token efficiency) وخفض التكلفة بنسبة 75% مقارنة بنسخة شهر يونيو من نموذج MAI الخاص بها. كما تروج الشركة لزيادة قدرها 4% في "بقاء الكود" (code survival) بعد تدريب النموذج في مئات الآلاف من بيئات التعلم التعزيزي داخل Copilot.
تروي الاختبارات المستقلة قصة مختلفة. ففي مجموعة اختبارات SWE-bench Verified، سجل MAI Code 1.1 Flash معدل نجاح قدره 72.6%، متفوقاً بفارق ضئيل على Claude Haiku 4.5 (69.8%) و GPT-5.4 mini (69.2%). وتعد هذه الميزة متواضعة ومقتصرة على مقياس واحد فقط.
وتتسع الفجوة في Terminal Bench 2.1، الذي يقيس قدرة النموذج على إكمال مهام سطر الأوامر (command-line) في العالم الحقيقي. هنا حقق MAI Code 1.1 Flash نتيجة 62.9%، بينما سجل DeepSeek-V4-Flash-0731 نتيجة 82.7%. وهذا الفرق كبير بما يكفي للتأثير على المطورين الذين يعتمدون على توليد الكود المرتكز على سطر الأوامر (terminal-centric).
نقاط ضغط التسعير
تسوق Microsoft النموذج الجديد كخيار "صديق للميزانية"، لكن تسعير الرموز (token pricing) يقول عكس ذلك. يفرض DeepSeek-V4-Flash مبلغ 0.14 دولار لكل رمز إدخال (input token) و0.28 دولار لكل رمز إخراج (output token). بينما يدرج MAI Code 1.1 Flash سعر 0.20 دولار للإدخال و1.20 دولار للإخراج. ويستقر Claude Haiku 4.5 عند 1.00 دولار و5.00 دولار على التوالي، مما يؤكد مكانته المتميزة (premium).
إن القفزة الحادة في تكلفة رموز الإخراج تعني أن أي سير عمل (workflow) يقوم بتوليد كتل برمجية كبيرة سيجد أن نموذج Microsoft أصبح الخيار الأكثر تكلفة، حتى بعد التخفيضات الموعودة من سلفه. وبالنسبة للمطورين والمؤسسات ذات النطاق الواسع، فإن الجدوى الاقتصادية تميل بشدة نحو DeepSeek.
كيف وصل MAI Code 1.1 Flash
يعد النموذج جزءاً من توجه Microsoft الأوسع لاستبدال خدمات الطرف الثالث في حزمة Copilot ببدائل مبنية داخلياً. ومن خلال التدريب على بيانات تعلم تعزيزي واسعة النطاق مستمدة من استخدام Copilot، تأمل Microsoft في إحكام حلقة التغذية الراجعة بين سلوك المستخدم وتحسين النموذج. كما يأتي هذا الإطلاق ضمن نمط من التحديثات التدريجية: حيث تم تقديم نسخة يونيو كموفر للتكاليف، بينما يتم تقديم نسخة Flash كخطوة تالية في هذا المسار.
الرابحون والخاسرون والرهانات الأوسع
قد تجد المؤسسات التي تسعى للتحكم في الإنفاق على الذكاء الاصطناعي أن تسعير DeepSeek أكثر جاذبية، خاصة عندما يكون حجم المخرجات مرتفعاً. وفي الوقت نفسه، تكتسب Microsoft سيطرة أوثق على منظومة Copilot والقدرة على توجيه الإيرادات بعيداً عن المزودين الخارجيين مثل OpenAI أو Anthropic.
دفاع Microsoft المحتمل
تؤكد بيانات Microsoft الخاصة على مكاسب كفاءة الرموز (token-efficiency) وتفوق متواضع في SWE-bench.
ما يجب مراقبته لاحقاً
- مقاييس الاعتماد: ستكشف إحصائيات استخدام Copilot عما إذا كان المطورون سينتقلون إلى الخيار الافتراضي الجديد أو سيستوردون نماذج بديلة عبر API.
- تعديلات الأسعار: إذا ظل سعر رموز الإخراج في Microsoft مرتفعاً، فقد تفرض ضغوط السوق مراجعة للأسعار.
- تحديثات الاختبارات المرجعية: قد تؤدي الإصدارات الجديدة من الاختبارات التي تركز على سطر الأوامر (terminal) إلى تغيير توازن الأداء، خاصة مع قيام Microsoft بتحسين مسار التعلم التعزيزي الخاص بها.
- المنافسة في النماذج مفتوحة الأوزان: قد يؤدي دخول نماذج إضافية مفتوحة الأوزان إلى مجال البرمجة إلى تكثيف السباق بين السعر والأداء.
الخلاصة
يحقق MAI Code 1.1 Flash مكاسب متواضعة في اختبار مرجعي ضيق، لكنه يقصر عن التفوق على نموذج DeepSeek مفتوح الأوزان من حيث أداء سطر الأوامر وتكلفة الرموز، مما يترك المطورين للمفاضلة بين سهولة التكامل وبين الكفاءة الخام.
