تفوق نموذج Kimi K3 الجديد من Moonshot AI على GPT-5.6 في اختبار AA-Briefcase، حيث سجل 1,527 نقطة مقابل 1,495 للنموذج الأخير. ويأتي هذا الفوز مع نموذج تسعير يجعل هذا النموذج مفتوح الأوزان (open-weight) الذي يضم 2.8 تريليون معلمة (parameter) خياراً رخيصاً بشكل مفاجئ لمهام البرمجة طويلة المدى.

لماذا يكتسب هذا الاختبار أهمية

يقيس AA-Briefcase الأداء في أعباء العمل المستمرة والواقعية بدلاً من الأسئلة العامة المنعزلة. وتعني الدرجة الأعلى أن النموذج يمكنه الحفاظ على السياق، والتخطيط المسبق، والبقاء في صلب المهمة عبر آلاف الرموز (tokens) – وهي بالضبط الظروف التي يواجهها المطورون عند بناء المساعدين، أو مولدات الأكواد، أو أدوات البحث. وتُظهر تفوق Kimi K3 على GPT-5.6 أن النماذج المفتوحة يمكنها الآن المنافسة في المجالات التي كانت تهيمن عليها المنافسة المغلقة تقليدياً.

الصورة التقنية

  • الحجم – 2.8 تريليون معلمة (parameter)، وهو أكبر نموذج مفتوح الأوزان تم إصداره حتى الآن.
  • البنية – Stable LatentMoE (Mixture-of-Experts) مع 896 خبيراً، يكون 16 منهم نشطاً في أي لحظة.
  • نافذة السياق – أكثر من مليون رمز (token)، وهو ما يكفي لاستيعاب كتب كاملة أو قواعد أكواد برمجية طويلة.
  • الانتباه – Kimi Delta Attention، وهو تعديل مخصص يُزعم أنه يحسن كفاءة التوسع (scaling efficiency).

تمنح هذه الخيارات النموذج القدرة على التعامل مع المهام "طويلة المدى" (long-horizon)، لكنها تزيد أيضاً من متطلبات الحوسبة، وهو ما يظهر في أرقام السرعة والتكلفة.

تسعير ملفت للانتباه

تقسم Moonshot تسعير الرموز (tokens) إلى ثلاث فئات:

نوع الاستخدام التكلفة لكل 1 مليون رمز
مدخلات – عدم وجود في الذاكرة المخبئية (cache miss) $3.00
مدخلات – وجود في الذاكرة المخبئية (cache hit) $0.30
مخرجات $15.00

تقول الشركة إن أعباء عمل البرمجة تشهد معدل "إصابة للذاكرة المخبئية" (cache-hit rate) بنسبة 90%. وإذا كان هذا صحيحاً، فإنه يمثل خياراً رخيصاً جداً لوكلاء البرمجة (coding agents).

المقايضات التي ستشعر بها

  • السرعة – يعالج النموذج حوالي 62 رمزاً (token) في الثانية، وهو أقل من متوسط المجال. قد تستغرق المطالبة (prompt) الطويلة دقائق، وهو أمر مهم للاستخدام التفاعلي.
  • تكلفة الاستدلال – يعمل Kimi K3 بـ "أقصى جهد استدلال" (max reasoning effort) بشكل افتراضي ولا يوفر خياراً لتقليله. لذلك، تستهلك الاستفسارات البسيطة نفس ميزانية الرموز التي تستهلكها الاستفسارات المعقدة، مما يؤدي إلى تضخم التكاليف للمهام الروتينية.
  • استخدام الرموز المخفي – أبلغ بعض المستخدمين عن وجود مطالبة نظام (system prompt) كبيرة يقوم النموذج بحقنها تلقائياً، مما يضيف رموزاً يتم فوترتها ولكنها غير مرئية في طلب المستخدم.

تعني هذه العوامل أن السعر المنخفض المعلن قد يتم تعويضه من خلال بطء الاستجابة واستهلاك الرموز الأعلى في الممارسة العملية.

التوفر والطريق أمامنا

واجهة برمجة التطبيقات (API) متاحة اليوم، مما يسمح للمطورين بالتجربة فوراً. سيتم إصدار أوزان النموذج نفسها في 27 يوليو، وبعد ذلك سيصبح الاستضافة الذاتية (self-hosting) ممكناً. وحتى ذلك الحين، يجب على المستخدمين الاعتماد على خدمة Moonshot المستضافة وقبول زمن الاستجابة وهيكل التسعير المرتبط بهما.

وجهة نظر معارضة من معسكر النماذج المغلقة

الخلاصة الناشئة

الخلاصة الرئيسية هي تقلص الفجوة بين النماذج المغلقة والنماذج المفتوحة. يثبت Kimi K3 أن النماذج مفتوحة الأوزان يمكنها التعامل مع المهام المعقدة وطويلة المدى.