أعلن باحثون عن إطار عمل جديد للتعلم التعزيزي يسمى Ring-Zero، يتيح لنموذج لغوي يحتوي على تريليون معلمة (trillion-parameter) تعلم الاستنتاج المنطقي مع البقاء ضمن حدود ميزانية الرموز (token-budget)، وقد حقق النموذج 84.2% في امتحان AIME للرياضيات لعام 2026. وتظهر هذه النتيجة أنه بهذا الحجم، يمكن للنموذج اكتساب عادات حل المشكلات خطوة بخطوة التي اعتاد المهندسون برمجتها يدويًا في الأوامر (prompts).
لماذا يهم هذا الأمر
لطالما كان الأداء بمستوى AIME معيارًا للقدرة على التفكير الكمي "بمستوى البشر". ويشير الوصول إلى نطاق 84.2% دون أي أمثلة مكتوبة بشريًا إلى أن قدرات الاستنتاج لدى النموذج تنبثق من ديناميكيات التدريب نفسها، وليس من الهياكل المصممة يدويًا. وبالنسبة للشركات التي تبني وكلاء ذكاء اصطناعي (AI agents)، فإن النتيجة واضحة: يمكن استبدال كتابة وصيانة وصفات الأوامر المعقدة بحلقة تدريب تعلم النموذج متى يحتاج إلى تفكير أعمق ومتى تكفي الاختصارات البسيطة.
من هندسة الأوامر إلى ديناميكيات التدريب
لسنوات، اعتمد المطورون على قوالب الأوامر مثل "جزئ المشكلة إلى أجزاء" أو "تحقق من إجابتك" لحث النماذج اللغوية الكبيرة على الاستنتاج متعدد الخطوات. تعمل هذه القوالب كهياكل خارجية؛ حيث يتبع النموذج التعليمات ولكنه لا يستوعب العملية داخليًا. يقلب Ring-Zero هذا النموذج؛ حيث يتلقى النموذج وصفًا للمهمة مع إجابة قابلة للتحقق — وهي الحقيقة المرجعية (ground-truth) التي يمكن فحصها تلقائيًا. ثم يقوم النموذج بإنشاء سلسلة من المحاولات، ولا يتلقى مكافأة إلا عندما تتطابق المحاولة مع الإجابة القابلة للتحقق، ويقوم بتحديث سياسته (policy) من خلال التعلم التعزيزي.
نظرًا لأن المكافأة ترتبط بهدف يصعب الغش فيه (يجب أن تكون الإجابة صحيحة، وليس مجرد منطقية)، يكتشف النموذج أنماط الاستنتاج من تلقاء نفسه. وتجادل الورقة البحثية بأنه بمجرد وجود إشارة مكافأة موثوقة، فإن توسيع النموذج إلى تريليون معلمة يظهر تلقائيًا أنواع حيل هندسة الأوامر التي كان المهندسون يدرجونها يدويًا في النماذج الأصغر.
مسار التدريب المكون من أربع خطوات
يمر تدريب Ring-Zero عبر أربع مراحل متميزة:
- المرحلة الأولى من التعلم التعزيزي (First-stage RL) – يستكشف النموذج مسارات الاستنتاج الممكنة، ويتعلم أي تسلسلات من الرموز (tokens) تميل إلى الوصول إلى إجابات صحيحة.
- التقطير الذاتي (Self-distillation) – تتدفق المسارات عالية الجودة مرة أخرى إلى النموذج، مما يؤدي إلى استقرار أنماط الاستنتاج الناشئة.
- المرحلة الثانية من التعلم التعزيزي (Second-stage RL) – تقوم حلقة أكثر دقة بصقل السياسة مع الحفاظ على التحسينات السابقة.
- التدريب المتدرج (Tiered training) – يتعلم النموذج تخصيص ميزانيات الرموز بذكاء، والاختيار بين مسارات استنتاج قصيرة (≈2 ألف رمز) وطويلة (≈20 ألف رمز) اعتمادًا على صعوبة المشكلة.
يعد التدريب المتدرج الجزء الأكثر صلة بالإنتاج الفعلي. ففي عمليات النشر الحقيقية، تضيف كل رمز إضافي تكلفة حوسبة. ومن خلال تعليم النموذج التعرف على متى تكون المشكلة بسيطة بما يكفي لإجابة قصيرة ومتى تستدعي تحليلًا عميقًا متعدد الخطوات، يربط Ring-Zero جودة الاستنتاج مباشرة بالكفاءة الاقتصادية.
مرحلتان من التعلم: الاكتشاف والصقل
يصف المؤلفون منحنى التعلم بأنه عملية مكونة من مرحلتين:
- الاكتشاف (Discovery) – تكون خطوات التعلم التعزيزي المبكرة مشوشة؛ حيث يجرب النموذج مجموعة واسعة من الاستراتيجيات، والتي يفشل الكثير منها. هذا التباين ضروري للكشف عن مسارات استنتاج جديدة.
- الصقل (Sharpening) – بمجرد ظهور نمط واعد، تعمل خطوات التعلم التعزيزي اللاحقة على إحكام السياسة، مما يقلل التباين ويوطد السلوك.
يعكس هذا التطور كيفية تحسن البشر: عصف ذهني أولي يليه ممارسة مركزة. والرؤية الأساسية هي ضرورة احتضان المرحلة المبكرة "الفوضوية" بدلاً من قمعها، لأنها توفر المادة الخام للتحسين اللاحق.
ما الذي قد يسير بشكل خاطئ؟
تعتمد تفاؤل الورقة البحثية على بعض الافتراضات التي تستحق التدقيق:
- تصميم المكافأة – يحتاج إطار العمل إلى مكافأة تكون قابلة للتحقق ومقاومة للاختصارات في آن واحد. بالنسبة للعديد من المهام في العالم الحقيقي، فإن تحديد مثل هذه المكافأة ليس بالأمر السهل وقد يتطلب خطوط أنابيب تعليق (annotation) مكلفة.
- الاختناقات البيئية – يشير المؤلفون إلى أن أداء النموذج لا يحده حجمه، بل البنية التحتية للتقييم المحيطة به (مجموعات الاختبار، السجلات، المقاييس الواضحة). يمكن أن يكون بناء وصيانة تلك البنية التحتية جهدًا هندسيًا كبيرًا.
- تكلفة حوسبة التدريب – إن تدريب نموذج يحتوي على تريليون معلمة مع مراحل متعددة من التعلم التعزيزي أمر مكلف. وبينما يقلل التدريب المتدرج من تكاليف الاستدلال، تظل ميزانية التدريب الأولية مرتفعة، مما قد يحصر هذا النهج في المختبرات ذات التمويل الجيد.
ما يجب مراقبته لاحقاً
خلاصات عملية لممارسي الذكاء الاصطناعي
- لا تتعامل مع الأوامر (prompts) كأداة وحيدة – تساءل عما إذا كان السلوك الذي تقوم ببرمجته داخل الأوامر يمكن تعلمه بدلاً من ذلك من خلال حلقة تدريب قائمة على المكافأة.
- اجعل استخدام الرموز (tokens) هدفاً أساسياً – أضف إشارات تراعي الميزانية في وقت مبكر؛ سيتعلم النموذج الموازنة بين الدقة وتكلفة الحوسبة.
- أغلق حلقة التغذية الراجعة – قم بنشر نظام يوفر المهام تلقائياً، ويقيس النتائج مقابل إجابات يمكن التحقق منها، ويغذي النتائج مرة أخرى في عملية التدريب. فالحلقة هي المكان الذي يكتشف فيه النموذج سير عمله الخاص.
عندما تكون المكافأة واضحة وتستطيع البيئة قياس النجاح بشكل موثوق، فإن توسيع نطاق النموذج يفعل أكثر من مجرد إضافة قدرة خام؛ إنه يعلم النموذج كيف يختار طريقة التفكير. هذا التحول من الهياكل المكتوبة يدوياً إلى الاستدلال الموجه ذاتياً قد يعيد تشكيل كيفية بناء وتسعير وكلاء الذكاء الاصطناعي (AI agents).
