طرحت Alibaba نموذج Qwen2.5-Max وDeepSeek نموذج V3-Flash في الأسواق هذا الأسبوع، حيث يسلك كل منهما مساراً مختلفاً لخفض تكلفة استنتاج الذكاء الاصطناعي (AI inference). تقوم Alibaba بتنشيط حوالي 95 مليار معلمة (parameter) فقط لكل استعلام باستخدام تصميم "خليط الخبراء" (mixture-of-experts - MoE) الذي يضم 2.4 تريليون معلمة؛ بينما تعمل DeepSeek على تقليص البنية التحتية لخفض السعر لكل رمز (token). لقد أصبح سباق التسلح في مجال الذكاء الاصطناعي يُقاس الآن بالدولار لكل رمز، وليس فقط بحجم النموذج.

من "المزيد من المعلمات" إلى "تكلفة أقل"

لسنوات عديدة، كان المقياس الرئيسي في تطوير النماذج اللغوية الكبيرة (LLM) هو عدد المعلمات. تفاخرت OpenAI وGoogle وغيرها بكسر حاجز التريليون معلمة، بافتراض أن الحجم الأكبر يعني ذكاءً أكبر. لكن Alibaba وDeepSeek تظهران أن الحسابات قد تغيرت.

لا يزال نموذج Qwen2.5-Max من Alibaba يعتمد على النطاق الواسع، لكنه يضيف حيلة لتوفير التكاليف. في النموذج الكثيف (dense model)، تعمل كل معلمة في كل عملية استنتاج، مما يحول الشبكة المكونة من 2.4 تريليون معلمة إلى وحش يستهلك الطاقة. أما تقنية MoE فتقسم الشبكة إلى العديد من "الخبراء" وتوجه كل طلب إلى مجموعة فرعية منهم. يختار موجه (router) Qwen2.5-Max حوالي 95 مليار معلمة لأي مطالبة (prompt)، مما يوفر قوة استدلال تضاهي نظاماً مكوناً من تريليون معلمة مع الحفاظ على زمن الاستجابة (latency) واستهلاك الطاقة تحت السيطرة.

تتخلى DeepSeek تماماً عن طموح التريليون معلمة. فقد تم بناء نموذج V3-Flash الخاص بها ليعمل بتكلفة منخفضة وسرعة عالية وعلى نطاق واسع. تسوق الشركة النموذج حول "أسعار استنتاج منخفضة للغاية"، مستهدفة المطورين الذين يعالجون ملايين الرموز (tokens) يومياً دون تكبد تكاليف باهظة. لم يتم الكشف عن السعر الدقيق، لكن الرسالة واضحة: إذا لم تتمكن الشركات الناشئة من تحمل أسعار الرموز الغربية، فإن V3-Flash سيصبح بديلاً قابلاً للتطبيق.

لماذا أصبحت تكلفة الاستنتاج ميزة تنافسية

تكتسب تكلفة الاستنتاج أهمية عندما تخرج النماذج من المختبرات وتدخل مرحلة الإنتاج. فالشركات التي تدمج النماذج اللغوية الكبيرة في روبوتات الدردشة، أو مسارات تحليل المستندات، أو محركات التوصية، تكتشف سريعاً أن تسعير الرموز يهيمن على النفقات التشغيلية. إن النموذج الذي يكلف نصف القيمة لكل رمز يمكن أن يضاعف الميزانية المخصصة للمبادرات الأخرى — مثل المزيد من البيانات، أو حركة مرور أعلى، أو ميزات إضافية.

تستهدف الشركتان الصينيتان قطاعات سوقية مختلفة. يعد نموذج MoE من Alibaba بأداء عالٍ للمهام المعقدة التي تتطلب استدلالاً مكثفاً مع الحفاظ على ميزانية حوسبة معتدلة لكل طلب. وفي الوقت نفسه، يجذب نموذج DeepSeek الأكثر رشاقة أعباء العمل ذات الحجم الكبير والحساسة لزمن الاستجابة، حيث تكون القوة الخام أقل أهمية من التكلفة المتوقعة.

يمكن لكلتا الاستراتيجيتين أن تقوضا المزودين الغربيين الذين يربطون النماذج الكبيرة بأسعار مرتفعة. فإذا حقق المطورون نتائج مماثلة بسعر رمز أرخص، فستضعف الحوافز للبقاء مع واجهات برمجة التطبيقات (APIs) باهظة الثمن.

المخاطر والفرص للنظام البيئي العالمي للذكاء الاصطناعي

  • الشركات الناشئة والمؤسسات الصغيرة والمتوسطة: تخفض تكاليف الاستنتاج المنخفضة حواجز الدخول إلى المنتجات القائمة على الذكاء الاصطناعي. الفرق التي كانت تحتاج سابقاً إلى رأس مال إضافي لفواتير الـ API يمكنها الآن بناء النماذج الأولية والإطلاق بميزانيات أكثر تقشفاً.
  • الشركات الكبرى: يمكن للشركات الضخمة التي تدير خدمات ذكاء اصطناعي داخلية تقليص النفقات التشغيلية، مما يوفر الأموال للاستحواذ على البيانات، أو ضبط النماذج (fine-tuning)، أو الحوسبة الإضافية.
  • المزودون الغربيون: تعتمد نماذج إيراداتهم على رسوم لكل رمز. إن التحول نحو البدائل التي تركز على التكلفة يجبرهم على خفض الأسعار أو التميز بقدرات لا تستطيع النماذج الأرخص مضاهاتها بعد.
  • المنظمون وصناع السياسات: قد يؤدي الذكاء الاصطناعي الأكثر بساطة في التكلفة إلى تسريع الاعتماد عبر القطاعات، مما يثير تساؤلات حول الرقابة، وخصوصية البيانات، ووتيرة الأتمتة.

المقايضات والحجج المضادة

نماذج MoE مثل Qwen2.5-Max ليست "وجبة مجانية". فمنطق التوجيه (routing logic) يضيف تعقيداً هندسياً، ويمكن للتنشيط المتفرق (sparse activation) أن ينتج أداءً غير متساوٍ عبر أنواع الاستعلامات المختلفة. إذا أخطأ الموجه، فقد يتصل الطلب بخبراء غير مثاليين، مما يؤدي إلى تدهور جودة المخرجات. علاوة على ذلك، لا تزال الأجهزة تفضل الحوسبة الكثيفة؛ فالمسرعات المتخصصة لاستنتاج MoE ليست منتشرة بعد، مما قد يحد من مكاسب الكفاءة في العالم الحقيقي.

كما تحمل فلسفة DeepSeek التي تضع التكلفة أولاً مخاطر أيضاً. فالتسعير الهجومي يعني غالباً قيوداً أشد على حجم النموذج وبيانات التدريب، مما قد يحد من الأداء. بالنسبة للتطبيقات التي تتطلب استدلالاً دقيقاً، قد يقصر النموذج الأرخص عن تلبية المتطلبات، مما يدفع المستخدمين للعودة نحو البدائل الأكبر والأغلى ثمناً.

وأخيراً، فإن "الذكاء مقابل الدولار" ليس سوى محور واحد من محاور المنافسة. تظل عوامل مثل زمن الاستجابة، والموثوقية، ودعم النظام البيئي، والامتثال للوائح الإقليمية عوامل حاسمة. ومن المرجح أن تهيمن الشركات التي تقدم حزمة متوازنة عبر جميع هذه الأبعاد، وليس فقط تلك التي تفوز بحرب الأسعار.

ما يجب مراقبته لاحقاً

  • إصدارات نتائج الاختبارات المعيارية: ستكشف التقييمات المستقلة لكفاءة توجيه MoE في Qwen2.5-Max وتكلفة الرموز (tokens) في V3-Flash ما إذا كان الضجيج الإعلامي سيترجم إلى وفورات ملموسة.
  • التطورات في الأجهزة: قد يؤدي اعتماد المسرعات المحسنة للتنشيط المتفرق (sparse activation) إلى تعزيز فوائد MoE، بينما قد تحافظ وحدات معالجة الرسومات (GPUs) للأغراض العامة على تنافسية النماذج الكثيفة (dense models).
  • استجابات التسعير: قد يقوم المزودون الغربيون بتعديل فئاتهم أو إضافة ميزات لتوفير التكاليف مثل خصومات الاستدلال بالدفعة (batch inference) أو الترخيص المحلي (on-premise).
  • التحركات التنظيمية: مع انتشار الذكاء الاصطناعي الأقل تكلفة، قد تضع الحكومات معايير للشفافية والسلامة قد تؤثر على كيفية نشر هذه النماذج على نطاق واسع.

الخلاصة

يُظهر نموذج Qwen2.5-Max القائم على MoE من Alibaba ونموذج V3-Flash منخفض التكلفة من DeepSeek أن سباق الذكاء الاصطناعي بات يعتمد الآن على جداول الميزانية بقدر ما يعتمد على عدد المعلمات (parameters). فالشركات التي تقدم قدرات لغوية متطورة مع الحفاظ على انخفاض تكلفة الرمز الواحد (per-token) ستفتح مجال الذكاء الاصطناعي لمجموعة أوسع من المستخدمين، مما يعيد تشكيل الديناميكيات التنافسية التي لطالما انحازت للنماذج الأكبر والأكثر تكلفة.