يتيح تحسين التفضيل المباشر (Direct Preference Optimization - DPO) للمطورين ضبط النماذج اللغوية الكبيرة بدقة دون الحاجة إلى تدريب نموذج مكافأة منفصل أو تشغيل حلقة تعلم تعزيزي (RL)، مما يقلل من تكاليف الحوسبة وعدم الاستقرار الذي غالبًا ما يعيب مسارات التعلم التعزيزي من التغذية الراجعة البشرية التقليدية.

لماذا يبدو التعلم التعزيزي من التغذية الراجعة البشرية (RLHF) عبئًا ثقيلًا

تتكون عملية التعلم التعزيزي من التغذية الراجعة البشرية (RLHF) القياسية من ثلاث مراحل. أولاً، يتم ضبط النموذج الأساسي بدقة باستخدام مجموعة بيانات منسقة. بعد ذلك، يتعلم نموذج المكافأة التنبؤ بالتفضيل البشري بين أزواج من المخرجات. وأخيرًا، يقوم الممارسون بتشغيل خوارزمية تحسين السياسة القريبة (Proximal Policy Optimization - PPO) - وهي خوارزمية RL كلاسيكية - لدفع السياسة نحو مكافآت متوقعة أعلى مع البقاء قريبًا من النموذج الأصلي.

يتطلب هذا الإعداد المكون من ثلاثة نماذج وجودها في الذاكرة في وقت واحد، ويفرض حلقة RL مكلفة تقوم بأخذ عينات من نصوص جديدة عند كل تحديث. غالبًا ما تلاحظ الفرق البحثية أن السياسة تتعلم "التلاعب" بالمكافأة، مما ينتج مخرجات تسجل درجات جيدة في النموذج البديل ولكنها تفتقر إلى الجودة المنشودة. والنتيجة هي مسار عمل مكلف، وهش، ويصعب توسيع نطاقه.

الاختصار الجبري لـ DPO

يتجاوز DPO نموذج المكافأة تمامًا. الملاحظة الرئيسية هي أن هدف RLHF - وهو تعظيم المكافأة المتوقعة مع معاقبة الانحراف عن النموذج المرجعي - له تعبير رياضي مغلق (closed-form expression). ومن خلال إعادة ترتيب الرياضيات، تصبح المكافأة لأي رمز (token) هي الفرق بين الاحتمالية اللوغاريتمية (log-probability) التي تحددها السياسة وتلك التي يحددها النموذج المرجعي.

من الناحية العملية، يعني هذا أن "المكافأة" موجودة داخل السياسة نفسها. يتقلص التدريب إلى خسارة تصنيف (classification loss) واحدة على أزواج التفضيل: عند إعطاء استجابة مختارة وأخرى مرفوضة، يتم دفع النموذج لتعيين احتمالية أعلى للنص المختار. لا حاجة لأخذ عينات، ولا تحديثات PPO، ولا نموذج إضافي للتخزين.

كيف تبدو دالة الخسارة الجديدة

تقارن دالة الخسارة بين الاحتمالية اللوغاريتمية للإجابة المفضلة في ظل السياسة الحالية وتلك في ظل النموذج المرجعي، مع قياسها بمعامل فائق (hyperparameter) يشبه درجة الحرارة $\beta$. قيمة $\beta$ العالية تجبر السياسة على البقاء بالقرب من المرجع، مما يحافظ على الطلاقة والسلامة. أما قيمة $\beta$ المنخفضة فتسمح للسياسة بالانحراف لمسافة أبعد، مما يزيد من حدة تفضيلها للإجابة المختارة.

فوائد تهم المطورين

  • لا حاجة لنموذج مكافأة – يلغي الحاجة إلى جمع تغذية راجعة بشرية إضافية لمتنبئ منفصل.
  • لا أخذ عينات أثناء التدريب – لا يقوم النموذج أبدًا بتوليد نصوص جديدة لحساب التدرجات (gradients)، مما يقلل وقت وحدة معالجة الرسومات (GPU) بشكل كبير.
  • الاستقرار – تحل خسارة الإنتروبيا المتقاطعة الثنائية (binary-cross-entropy loss) القياسية محل تدرجات RL عالية التباين التي غالبًا ما تسبب التباعد.
  • الكفاءة – تكفي خطوة تدرج واحدة لكل زوج تفضيل؛ حيث يتقارب التدريب في عدد دورات (epochs) أقل بكثير مما يتطلبه PPO.

تظهر التجارب الأولية أن DPO يضاهي أو يتفوق على أداء PPO في مجموعات بيانات التفضيل المرجعية، مع استخدام جزء ضئيل من ميزانية الحوسبة. هذه الميزة في التكلفة تفسر سبب اعتماد العديد من المشاريع مفتوحة المصدر بالفعل لـ DPO أو متغير قريب منه كطريقة افتراضية للمحاذاة (alignment).

المقايضات

يعمل DPO على مجموعة ثابتة من أزواج التفضيل. ولأنه لا يأخذ عينات من إكمالات جديدة أثناء التدريب، فإنه لا يستطيع استكشاف مساحات الإجابات التي كانت غائبة عن البيانات الأصلية. في المقابل، يمكن لتشغيل PPO عبر الإنترنت (online) اكتشاف سلوكيات جديدة ذات مكافأة أعلى من خلال اختبار النموذج باستمرار.

إذا تم ضبط $\beta$ على قيمة منخفضة جدًا أو استمر التدريب لخطوات كثيرة جدًا، فقد تنحرف السياسة بعيدًا عن النموذج المرجعي بما يكفي لفقدان الطلاقة أو إدخال عيوب (artefacts) غير مرغوب فيها.

الخلاصة

يستبدل تحسين التفضيل المباشر (DPO) حزمة RLHF المكونة من ثلاثة نماذج والمثقلة بالتعلم التعزيزي بدالة خسارة واحدة ومستقرة تتعلم مباشرة من أزواج التفضيل البشرية. والنتيجة هي مسار أرخص وأكثر قابلية للتنبؤ لمحاذاة النماذج اللغوية - بشرط أن تلتقط بيانات التدريب السلوكيات التي تحتاجها وأن تحافظ على ضبط معامل الانحراف.