تعثر نموذج Kimi K3 بينما اجتاز GPT-5.6-SOL خط النهاية في ثلاثة اختبارات معقدة للغاية—مسألة احتمالات، وسيناريو عطالة البكرة، وبرمجية Python معقدة لمشكلة حقيبة الظهر. يوضح هذا الفارق أهمية ميزانية الرموز (tokens) وزمن الاستجابة (latency) عندما تحتاج إلى نموذج يمكنه التفكير في الرياضيات والفيزياء والبرمجة عبر خطوات متعددة دون توقف.

لماذا يهم هذا الاختبار المعياري

غالبًا ما يختار المطورون والباحثون النماذج اللغوية الكبيرة (LLM) بناءً على النتائج البارزة، وليس بناءً على كيفية أدائها تحت ضغط العالم الحقيقي. في هذا الاختبار المقارن، واجه كل نموذج مشكلة تتطلب سلسلة طويلة من التفكير المنطقي. قدم GPT-5.6-SOL إجابات كاملة وصحيحة في المجالات الثلاثة؛ بينما استنفد Kimi K3 ميزانية الرموز الخاصة به أو انتهى الوقت المخصص له قبل تقديم أي نتيجة قابلة للاستخدام.

إعداد الاختبار

  • الرياضيات – سؤال في الاحتمالات تطلب حساب احتمال تداخل الأنماط، بالإضافة إلى التوقع والتباين (العزوم الثانية).
  • الفيزياء – نمذجة عطالة البكرة وفقدان الطاقة عندما يرتخي كابل مشدود بنوابض.
  • البرمجة – كتابة حل بلغة Python لمشكلة ترتيب حقائب الظهر مع وجود تبعات معقدة وقواعد لكسر التعادل، ثم التحقق من المخرجات مقابل ست حالات اختبار مستقلة.

ماذا تقول الأرقام

GPT-5.6-SOL

  • الرياضيات – قدم حلاً كاملاً وصحيحاً مع توضيح القيمة المتوقعة والتباين بشكل جلي.
  • الفيزياء – بنى نموذج العطالة بشكل صحيح وحسب فقدان الطاقة، مطابِقاً الإجابة التحليلية.
  • البرمجة – أنتج كوداً تم تجميعه وتشغيله واجتاز جميع الاختبارات الستة الخارجية. ومع ذلك، كان هناك خطأ في أحد اختبارات التأكيد (assertion) الداخلية، مما يذكرنا بأن الاختبارات التي يولدها النموذج ليست معصومة من الخطأ.

Kimi K3

  • الرياضيات – وصل إلى الحد الأقصى للرموز (أولاً عند 6,500 رمز، ثم عند 10,000 رمز) وتوقف دون إظهار أي إجابة.
  • الفيزياء – نفدت الرموز قبل ظهور أي مخرجات مرئية.
  • البرمجة – انتهى الوقت المخصص له بعد 245 ثانية، دون تقديم أي شيء للتقييم.

كفاءة التفكير مقابل القوة الخام

النتيجة واضحة لأي شخص يبني مسارات إنتاج (production pipelines): النموذج الذي يستهلك الرموز دون تقديم مخرجات يمكن أن يعطل العمليات اللاحقة، ويزيد التكاليف، ويحبط المستخدمين.

الموثوقية والتكلفة الخفية للكود "المثالي"

حتى النموذج الفائز تعثر: احتوت حالة الاختبار التي ولدها GPT-5.6-SOL ذاتياً على تأكيد خاطئ. وهذا يوضح أن التحقق الذي ينتجه النموذج ليس بديلاً عن المراجعة البشرية. عندما يكتب النموذج كوداً، لا تزال بحاجة إلى إجراء فحوصات مستقلة.

ما يجب مراقبته لاحقاً

  • تتبع سبب الانتهاء – تسجيل ما إذا كانت الاستجابة قد انتهت بسبب الوصول إلى حد الرموز، أو انتهاء الوقت، أو التوقف الطبيعي.
  • عدد رموز التفكير – مقارنة عدد الرموز التي ينفقها كل نموذج في التفكير الداخلي مقابل المخرجات النهائية.
  • مراقبة زمن الاستجابة – قياس الوقت الفعلي لكل خطوة؛ فالنموذج الذي يستغرق دقائق لكل استعلام قد لا يكون مناسباً للتطبيقات التفاعلية.

يجب على المطورين التعامل مع هذه المقاييس كإشارات أساسية، وليس فقط كإجابة نهائية.

الخلاصة

يتفوق GPT-5.6-SOL على Kimi K3 من حيث الاكتمال. كما يذكرنا الاختبار بأنه حتى النموذج الذي "يصيب الهدف" يمكن أن ينتج فحوصات داخلية معيبة، لذا تظل الإشراف البشري أمراً ضرورياً. إن تتبع أسباب الانتهاء، واستخدام الرموز، وزمن الاستجابة سيساعدك على اختيار الأداة المناسبة للمهمة دون الوقوع في فخ انتهاء الوقت الصامت.