أعلنت LongStraw أن تقنية "إعادة تشغيل الفروع" (branch-replay) الخاصة بها يمكنها معالجة 2.1 مليون موضع رمز (token position) للتدريب اللاحق باستخدام التعلم التعزيزي (RL) باستخدام ثماني وحدات معالجة رسومات H20 فقط، مما يقلل فاتورة الأجهزة بمقدار عشرة أضعاف. تكتسب هذه المزاعم أهمية كبيرة لأن تدريب نماذج السياق الطويل كان يتطلب تقليديًا عشرات من وحدات معالجة الرسومات عالية الأداء، وهو ما يمثل عائقًا أمام معظم مختبرات الأبحاث والشركات الناشئة.

لماذا يعد التعلم التعزيزي (RL) للسياق الطويل مكلفًا

عادةً ما تقوم عملية الضبط الدقيق لنماذج اللغة الكبيرة القائمة على التعلم التعزيزي (RL) بتشغيل عمليات استطلاع (rollouts) تولد العديد من الإكمالات البديلة لنفس المطالبة (prompt). يجب إجراء انتشار عكسي (back-propagation) لكل عملية استطلاع، لذا تتناسب تكلفة الحوسبة مع العدد الإجمالي لمواضع الرموز التي تتم معالجتها. غالبًا ما تحتاج خطوط الأنابيب الحالية التي تهدف إلى سياق يبلغ مليون رمز إلى 64 إلى 128 وحدة معالجة رسومات لإتمام المهمة في نافذة زمنية معقولة. وتحد تكلفة هذه الأجهزة، بالإضافة إلى الكهرباء والتبريد الذي تتطلبه، من المدى الذي يمكن للممارسين الوصول إليه في طول السياق.

كيف تقلل تقنية "إعادة تشغيل الفروع" من عبء العمل

يعتمد نهج LongStraw على ملاحظتين حول توليد نماذج Transformer:

  • المطالبة (prompt) والجزء الأولي من الاستجابة متطابقان عبر عمليات الاستطلاع المختلفة.
  • الجزء المتشعب (divergent tail) فقط من كل استجابة هو ما يحتاج فعليًا إلى حوسبة جديدة.

يبني النظام مكدس تنفيذ مدرك للبنية (architecture-aware execution stack) يسجل التنشيطات (activations) للبادئة المشتركة. وعند استكشاف فرع جديد، يقوم النظام بإعادة تشغيل البادئة المخزنة مؤقتًا بدلاً من إعادة حسابها، ثم يقوم بتشغيل التمرير العكسي (backward pass) فقط على الجزء الجديد. ومن الناحية العملية، يعني هذا أن التمرير العكسي يمس مواضع رموز أقل بكثير، مما يوفر انخفاضًا بمقدار 8 إلى 16 ضعفًا في الحوسبة الخام.

التأثير الفوري

  • معالجة 2.1 مليون موضع رمز باستخدام ثماني وحدات معالجة رسومات H20، وهي ميزانية أجهزة كانت ستدعم في العادة جزءًا ضئيلًا فقط من عبء العمل هذا.
  • استهداف مباشر لعنق الزجاجة في التعلم التعزيزي (RL) للسياق الطويل، حيث تنفجر تكاليف الذاكرة والحوسبة مع نمو السياق.
  • يمكن للمختبرات تغيير تخصيص وحدات معالجة الرسومات: الأجهزة نفسها، والتي تُستخدم أساسًا كمسرعات للاستدلال (inference accelerator)، قد تُستخدم الآن للتدريب، على الرغم من أن النتائج قد تختلف على بطاقات أخرى.

أسئلة مفتوحة وحدود

يغفل الإعلان أرقام سرعة التدريب ومنحنيات التقارب، لذا لا نعرف ما إذا كان خفض الحوسبة يترجم إلى وقت تشغيل فعلي أسرع (wall-clock time) أو مجرد انخفاض في إشغال وحدات معالجة الرسومات. تم وصف الطريقة لأخذ العينات ذاتية الانحدار (autoregressive sampling)؛ أما سلوكها مع الاستراتيجيات غير ذاتية الانحدار أو الهجينة فلا يزال غير مختبر. ولأن H20 هو مسرع استدلال في المقام الأول، فقد يختلف الأداء على بطاقات التدريب الأكثر شيوعًا مثل H100 أو B200.

لم تتحقق الاختبارات القياسية المستقلة بعد من أرقام LongStraw. وبدون التحقق من طرف ثالث، يجب على المجتمع التعامل مع النتائج على أنها واعدة ولكنها مؤقتة.

ما هو على المحك

إذا امتدت فكرة "إعادة تشغيل الفروع" إلى خوارزميات الضبط الدقيق الأخرى للتعلم التعزيزي مثل تحسين التفضيل المباشر (DPO) أو تحسين السياسة القريبة (PPO)، فقد تتبدد حاجز التكلفة لنماذج السياق الطويل.

ما يجب مراقبته

  • محاولات إعادة التطبيق من قبل أطراف ثالثة على مجموعة من بنيات وحدات معالجة الرسومات.
  • تحديثات من LongStraw حول إنتاجية التدريب وجودة النموذج النهائية مقارنة بخطوط الأنابيب الأساسية (baseline pipelines).