Direct Preference Optimization (DPO) डेवलपर्स को एक अलग रिवॉर्ड मॉडल (reward model) को प्रशिक्षित किए बिना या रीइन्फोर्समेंट लर्निंग (RL) लूप चलाए बिना लार्ज लैंग्वेज मॉडल्स को फाइन-ट्यून करने की सुविधा देता है, जिससे कंप्यूटिंग लागत और उस अस्थिरता (instability) दोनों में कमी आती है जो अक्सर पारंपरिक RL-from-human-feedback पाइपलाइनों में देखी जाती है।

RL-from-Human-Feedback भारी क्यों महसूस होता है

मानक RL-from-human-feedback (RLHF) प्रक्रिया के तीन चरण होते हैं। सबसे पहले, एक क्यूरेटेड डेटासेट पर बेस मॉडल को फाइन-ट्यून किया जाता है। इसके बाद, एक रिवॉर्ड मॉडल आउटपुट के जोड़ों के बीच मानवीय पसंद (human preference) का अनुमान लगाना सीखता है। अंत में, विशेषज्ञ Proximal Policy Optimization (PPO) – जो कि एक क्लासिक RL एल्गोरिदम है – चलाते हैं ताकि पॉलिसी को मूल मॉडल के करीब रखते हुए उच्च अनुमानित रिवॉर्ड की ओर धकेला जा सके।

वह तीन-मॉडल सेटअप एक साथ मेमोरी में रहता है और एक महंगी RL लूप को मजबूर करता है जो हर अपडेट पर नए टेक्स्ट को सैंपल करती है। टीमें अक्सर देखती हैं कि पॉलिसी रिवॉर्ड को "गेम" (game) करना सीख जाती है, जिससे ऐसे आउटपुट मिलते हैं जो प्रॉक्सी पर तो अच्छा स्कोर करते हैं लेकिन अपेक्षित गुणवत्ता (quality) में कमी रह जाती है। इसका परिणाम एक ऐसी पाइपलाइन के रूप में निकलता है जो महंगी, नाजुक और स्केल करने में कठिन होती है।

DPO का बीजगणितीय शॉर्टकट (algebraic shortcut)

DPO रिवॉर्ड मॉडल को पूरी तरह से छोड़ देता है। मुख्य अवलोकन यह है कि RLHF का उद्देश्य – एक रेफरेंस मॉडल से विचलन (divergence) को दंडित करते हुए अपेक्षित रिवॉर्ड को अधिकतम करना – एक क्लोज्ड-फॉर्म एक्सप्रेशन (closed-form expression) रखता है। गणित को पुनर्व्यवस्थित करके, किसी भी टोकन के लिए रिवॉर्ड, पॉलिसी द्वारा दिए गए लॉग-प्रोबेबिलिटी (log-probability) और रेफरेंस मॉडल द्वारा दिए गए लॉग-प्रोबेबिलिटी के बीच का अंतर बन जाता है।

व्यवहार में इसका अर्थ है कि "रिवॉर्ड" स्वयं पॉलिसी के भीतर ही होता है। ट्रेनिंग केवल प्रेफरेंस पेयर्स (preference pairs) पर एक सिंगल क्लासिफिकेशन लॉस (classification loss) तक सीमित हो जाती है: एक चुने हुए रिस्पॉन्स और एक अस्वीकृत रिस्पॉन्स को देखते हुए, मॉडल को चुने हुए टेक्स्ट को उच्च प्रोबेबिलिटी देने के लिए प्रेरित किया जाता है। कोई सैंपलिंग नहीं, कोई PPO अपडेट नहीं, और स्टोर करने के लिए कोई अतिरिक्त मॉडल नहीं।

नया लॉस (loss) कैसा दिखता है

यह लॉस वर्तमान पॉलिसी के तहत पसंदीदा उत्तर की लॉग-प्रोबेबिलिटी की तुलना रेफरेंस मॉडल के तहत लॉग-प्रोबेबिलिटी से करता है, जिसे एक टेम्परेचर जैसे हाइपरपैरामीटर β द्वारा स्केल किया जाता है। एक उच्च β पॉलिसी को रेफरेंस के करीब रहने के लिए मजबूर करता है, जिससे प्रवाह (fluency) और सुरक्षा बनी रहती है। एक कम β पॉलिसी को और अधिक भटकने (drift) देता है, जिससे चुने हुए उत्तर के लिए उसकी प्राथमिकता और अधिक स्पष्ट हो जाती है।

डेवलपर्स के लिए महत्वपूर्ण लाभ

  • कोई रिवॉर्ड मॉडल नहीं – एक अलग प्रेडिक्टर के लिए अतिरिक्त मानवीय फीडबैक एकत्र करने की आवश्यकता को समाप्त करता है।
  • ट्रेनिंग के दौरान कोई सैंपलिंग नहीं – मॉडल ग्रेडिएंट्स की गणना करने के लिए कभी भी नया टेक्स्ट जेनरेट नहीं करता है, जिससे GPU समय में भारी कमी आती है।
  • स्थिरता (Stability) – एक मानक बाइनरी-क्रॉस-एन्ट्रॉपी लॉस, हाई-वैरिएंस RL ग्रेडिएंट्स की जगह लेता है जो अक्सर विचलन (divergence) का कारण बनते हैं।
  • दक्षता (Efficiency) – प्रत्येक प्रेफरेंस पेयर पर एक सिंगल ग्रेडिएंट स्टेप पर्याप्त है; ट्रेनिंग PPO की तुलना में बहुत कम इपोक (epochs) में कन्वर्ज हो जाती है।

शुरुआती प्रयोग दिखाते हैं कि DPO, कंप्यूट बजट के एक छोटे से हिस्से का उपयोग करते हुए बेंचमार्क प्रेफरेंस डेटासेट पर PPO के प्रदर्शन के बराबर या उससे बेहतर प्रदर्शन करता है। यही लागत लाभ बताता है कि क्यों कई ओपन-सोर्स प्रोजेक्ट्स ने पहले ही DPO या इसके किसी करीबी वेरिएंट को अपने डिफॉल्ट अलाइनमेंट मेथड के रूप में अपना लिया है।

ट्रेड-ऑफ (Trade-offs)

DPO प्रेफरेंस पेयर्स के एक निश्चित सेट पर काम करता है। चूंकि यह ट्रेनिंग के दौरान कभी भी नए कंपलीशन (completions) को सैंपल नहीं करता है, इसलिए यह उन उत्तर स्थानों (answer spaces) का पता नहीं लगा सकता जो मूल डेटा में अनुपस्थित थे। इसके विपरीत, एक ऑनलाइन PPO रन मॉडल की लगातार जांच करके नए, उच्च-रिवॉर्ड वाले व्यवहारों की खोज कर सकता है।

यदि β को बहुत कम सेट किया जाता है या ट्रेनिंग बहुत अधिक स्टेप्स तक चलती है, तो पॉलिसी रेफरेंस मॉडल से इतना दूर भटक सकती है कि वह प्रवाह (fluency) खो दे या अवांछित आर्टिफैक्ट्स (artefacts) पेश कर दे।

निष्कर्ष (Takeaway)

Direct Preference Optimization, तीन-मॉडल और RL-भारी RLHF स्टैक को एक सिंगल, स्थिर लॉस से बदल देता है जो सीधे मानवीय प्रेफरेंस पेयर्स से सीखता है। इसका परिणाम भाषा मॉडल्स को अलाइन करने के लिए एक सस्ता और अधिक अनुमानित रास्ता है—बशर्ते कि ट्रेनिंग डेटा उन व्यवहारों को कैप्चर करे जिनकी आपको आवश्यकता है और आप ड्रिफ्ट पैरामीटर को नियंत्रण में रखें।