أتمّ GPT-5.6-SOL ثلاث مهام متعددة الخطوات في الرياضيات والفيزياء والبرمجة، بينما نفدت ميزانية الرموز (tokens) الخاصة بـ Kimi K3 وانتهى الوقت المخصص له عند استخدام نفس الأوامر، مما كشف عن قصور عملي للمطورين الذين يحتاجون إلى إجابات موثوقة وشاملة.

لماذا يكتسب هذا الاختبار أهمية

تلقى كلا النموذجين أوامر متطابقة تحت سقف رموز (token ceiling) واحد، دون تفعيل أدوات البحث عبر الإنترنت. ركز الاختبار المعياري على الاستنتاج متعدد الخطوات، وهو حاجة شائعة في الحسابات العلمية وتوليد الأكواد. وفي بيئة الإنتاج، يمكن للنموذج الذي يستنفد حصته من الرموز قبل تقديم النتيجة النهائية أن يعطل مسارات العمل (pipelines) ويضيف أعباءً إضافية في عملية تصحيح الأخطاء (debugging).

ما حدث في المواجهة المباشرة

GPT-5.6-SOL

  • قدم إجابة كاملة لكل تحدٍ من التحديات الثلاثة.
  • قدم اشتقاقات رياضية وفيزيائية صحيحة.
  • ولّد نصاً برمجياً بلغة Python تم تجميعه وتشغيله على مفسر (interpreter) محلي.
  • أغفل حالة اختبار (test case) في المخرجات المثال، لكن المنطق الأساسي ظل سليماً.

Kimi K3

  • فشل في تقديم حل مرئي لمسائل الرياضيات والفيزياء.
  • وصل إلى حد الرموز (token limit) بشكل متكرر، مما أدى إلى قطع استنتاجه قبل ظهور النتيجة.
  • توقف بعد 245 ثانية في مهمة البرمجة، دون تقديم أي كود قابل للتشغيل.

خلاصات رئيسية للممارسين

  • رموز الاستنتاج مقابل المخرجات النهائية – يستهلك Kimi K3 جزءاً كبيراً من ميزانية الرموز الخاصة به في سلاسل التفكير الداخلية. وعندما تكون الميزانية ثابتة، غالباً ما ينفد من المساحة قبل أن يتمكن من إصدار الإجابة، مما يجعله غير مناسب لتدفقات العمل التي تتطلب نتيجة فورية.
  • المنطق مقابل الاختبار – حتى النموذج الذي يصيب في الاستنتاج قد يخطئ في التفاصيل الثانوية. تذكرنا حالة الاختبار غير الصحيحة في GPT-5.6-SOL بضرورة فحص كود التحقق المُولّد يدوياً.
  • أهمية زمن الاستجابة وأسباب التوقف – يجب أن تسجل مسارات الإنتاج ليس فقط الإجابة النهائية، بل أيضاً سبب توقف النموذج (حد الرموز، انتهاء الوقت، إلخ) وعدد الرموز التي استهلكها في الاستنتاج.

ما يجب مراقبته لاحقاً

إلى أن تظهر مثل هذه التغييرات، من المرجح أن يفضل المطورون الذين يحتاجون إلى نتائج موثوقة وشاملة نماذج مثل GPT-5.6-SOL للمهام التي تتضمن حسابات متسلسلة أو توليف الأكواد (code synthesis).

بالنسبة للفرق التي تبني أنظمة مؤتمتة، يؤكد هذا الاختبار المعياري على قاعدة بسيطة: اختبر كلاً من صحة الإجابة وقدرة النموذج على الوصول إلى تلك الإجابة ضمن القيود التشغيلية التي تفرضها. فالنموذج الذي "يفكر" ولكنه لا ينتهي أبداً ليس أكثر من طريق مسدود.