Direct Preference Optimization (DPO) என்பது தனிப்பயனாக்கப்பட்ட வெகுமதி மாதிரியை (reward model) பயிற்சியளிக்காமலோ அல்லது reinforcement-learning (RL) சுழற்சியை இயக்காமலோ பெரிய மொழி மாதிரிகளை (large language models) நுணுக்கமாகச் சரிசெய்ய (fine-tune) டெவலப்பர்களுக்கு அனுமதிக்கிறது. இது கணக்கீட்டுச் செலவுகள் மற்றும் பாரம்பரிய RLHF வழிமுறைகளில் அடிக்கடி ஏற்படும் நிலையற்ற தன்மையைக் குறைக்கிறது.
ஏன் RL-from-Human-Feedback கடினமாகத் தோன்றுகிறது
வழக்கமான RL-from-human-feedback (RLHF) முறை மூன்று நிலைகளைக் கொண்டது. முதலில், ஒரு அடிப்படை மாதிரி (base model) தேர்ந்தெடுக்கப்பட்ட தரவுத்தொகுப்பில் நுணுக்கமான சரிசெய்தலுக்கு உட்படுத்தப்படுகிறது. அடுத்து, ஒரு வெகுமதி மாதிரி (reward model) ஜோடி வெளியீடுகளுக்கு இடையிலான மனித முன்னுரிமைகளைத் தீர்மானிக்கக் கற்றுக்கொள்கிறது. இறுதியாக, பயிற்சியாளர்கள் Proximal Policy Optimization (PPO) எனப்படும் ஒரு பாரம்பரிய RL அல்காரிதத்தைப் பயன்படுத்தி, அசல் மாதிரியிலிருந்து விலகிச் செல்லாமல் அதிக வெகுமதிகளைப் பெறும் வகையில் கொள்கையை (policy) மாற்றியமைக்கின்றனர்.
இந்த மூன்று மாதிரிகள் ஒரே நேரத்தில் நினைவகத்தில் (memory) இருக்க வேண்டியுள்ளது மற்றும் ஒவ்வொரு புதுப்பிப்பின் போதும் புதிய உரையைச் சேகரிக்க வேண்டிய ஒரு செலவு மிகுந்த RL சுழற்சியைத் தூண்டுகிறது. குழுக்கள் பெரும்பாலும் கொள்கை (policy) வெகுமதியை "ஏமாற்றுவதை" (game) காண்கின்றன; அதாவது, இது ஒரு மாதிரிக்குச் சரியாகத் தெரிந்தாலும், உண்மையான தரத்தை இழந்துவிடும். இதன் விளைவாக, அதிக செலவு மற்றும் நிலையற்ற தன்மை கொண்ட ஒரு வழிமுறை உருவாகிறது.
DPO-வின் இயற்கணித குறுக்குவழி (algebraic shortcut)
DPO வெகுமதி மாதிரியை முற்றிலும் தவிர்க்கிறது. RLHF-ன் நோக்கம் - அதாவது ஒரு குறிப்பு மாதிரியிலிருந்து (reference model) விலகிச் செல்வதைத் தடுத்து, எதிர்பார்க்கப்படும் வெகுமதியை அதிகப்படுத்துவது - ஒரு மூடிய வடிவ வெளிப்பாட்டை (closed-form expression) கொண்டுள்ளது என்பதே இதன் முக்கியக் கண்டுபிடிப்பாகும். கணிதத்தை மறுசீரமைப்பதன் மூலம், எந்தவொரு டோக்கனுக்கான வெகுமதியும், கொள்கையினால் (policy) வழங்கப்பட்ட மடக்கை நிகழ்தகவிற்கும் (log-probability), குறிப்பு மாதிரியால் வழங்கப்பட்ட மடக்கை நிகழ்தகவிற்கும் இடையிலான வேறுபாடாக மாறுகிறது.
நடைமுறையில், இதன் பொருள் "வெகுமதி" என்பது கொள்கையிலேயே (policy) உள்ளது என்பதாகும். பயிற்சி என்பது முன்னுரிமை ஜோடிகளின் மீதான ஒரு ஒற்றை வகைப்பாட்டு இழப்பாக (classification loss) குறைகிறது: ஒரு தேர்ந்தெடுக்கப்பட்ட பதில் மற்றும் நிராகரிக்கப்பட்ட பதில் கொடுக்கப்பட்டால், தேர்ந்தெடுக்கப்பட்ட உரத்திற்கு அதிக நிகழ்தகவை வழங்க மாடல் தூண்டப்படுகிறது. இதில் மாதிரி எடுத்தல் (sampling), PPO புதுப்பிப்புகள் அல்லது சேமிக்க வேண்டிய கூடுதல் மாதிரிகள் எதுவும் தேவையில்லை.
புதிய இழப்பு (loss) எவ்வாறு இருக்கும்
இந்த இழப்பு (loss), தற்போதைய கொள்கையின் கீழ் விரும்பிய பதிலின் மடக்கை நிகழ்தகவை (log-probability), குறிப்பு மாதிரியின் மடக்கை நிகழ்தகவுடன் ஒப்பிடுகிறது; இது $\beta$ போன்ற ஒரு ஹைப்பர்-பாராமீட்டரால் அளவிடப்படுகிறது. அதிக $\beta$ மதிப்பு, கொள்கை குறிப்பு மாதிரியின் அருகிலேயே இருக்குமாறு கட்டாயப்படுத்துகிறது, இது சரளத்தையும் (fluency) பாதுகாப்பையும் உறுதி செய்கிறது. குறைந்த $\beta$ மதிப்பு, கொள்கையைத் தாராளமாக நகர அனுமதிக்கிறது, இது தேர்ந்தெடுக்கப்பட்ட பதிலுக்கான முன்னுரிமையை அதிகப்படுத்துகிறது.
டெவலப்பர்களுக்குப் பயனுள்ள நன்மைகள்
- வெகுமதி மாதிரி தேவையில்லை – தனிப்பயனாக்கப்பட்ட கணிப்பிற்காக கூடுதல் மனித பின்னூட்டங்களைச் சேகரிக்க வேண்டிய அவசியத்தை இது நீக்குகிறது.
- பயிற்சியின் போது மாதிரி எடுத்தல் (sampling) தேவையில்லை – கிரேடியன்ட்களைக் (gradients) கணக்கிட மாடல் புதிய உரையை உருவாக்க வேண்டியதில்லை, இது GPU நேரத்தை வியக்கத்தக்க வகையில் குறைக்கிறது.
- நிலையான தன்மை (Stability) – நிலையற்ற தன்மையை ஏற்படுத்தும் அதிக மாறுபாட்டு கொண்ட RL கிரேடியன்ட்களுக்குப் பதிலாக, ஒரு நிலையான binary-cross-entropy இழப்பு பயன்படுத்தப்படுகிறது.
- திறன் (Efficiency) – ஒவ்வொரு முன்னுரிமை ஜோடிக்கும் ஒரு ஒற்றை கிரேடியன்ட் படிப்பு போதுமானது; PPO-வை விட மிகக் குறைவான எபோக்குகளில் (epochs) பயிற்சி நிறைவடைகிறது.
ஆரம்பகால சோதனைகள், DPO மிகக் குறைந்த கணக்கீட்டுத் திறனைப் பயன்படுத்தி, பெஞ்ச்மார்க் முன்னுரிமை தரவுத்தொகுப்புகளில் PPO-வின் செயல்திறனுக்கு இணையாக அல்லது அதைவிடச் சிறப்பாகச் செயல்படுவதைக் காட்டுகின்றன. இந்தச் செலவுச் சாதகமே பல திறந்த மூல (open-source) திட்டங்கள் ஏற்கனவே DPO அல்லது அதன் மாறுபட்ட முறையைத் தங்களின் இயல்புநிலை சீரமைப்பு முறையாக (default alignment method) ஏற்றுக்கொண்டதற்குக் காரணமாகும்.
வர்த்தகப் பரிமாற்றங்கள் (Trade-offs)
DPO ஒரு நிலையான முன்னுரிமை ஜோடிகளின் தொகுப்பில் செயல்படுகிறது. பயிற்சியின் போது இது புதிய முடிவுகளை (completions) மாதிரி எடுக்காததால், அசல் தரவில் இல்லாத புதிய பதில்களைக் கண்டறிய முடியாது. இதற்கு நேர்மாறாக, ஒரு ஆன்லைன் PPO இயக்கம், மாதிரியைத் தொடர்ந்து சோதிப்பதன் மூலம் புதிய மற்றும் அதிக வெகுமதி கொண்ட நடத்தைகளைக் கண்டறிய முடியும்.
$\beta$ மிகக் குறைவாக அமைக்கப்பட்டாலோ அல்லது பயிற்சி மிக அதிகமான படிகளுக்குச் சென்றாலோ, கொள்கை குறிப்பு மாதிரியிலிருந்து விலகிச் சென்று, சரளத்தன்மையை இழக்கலாம் அல்லது தேவையற்ற பிழைகளை (artefacts) உருவாக்கலாம்.
சுருக்கம் (Takeaway)
Direct Preference Optimization என்பது மூன்று மாதிரிகள் மற்றும் அதிக RL தேவைப்படும் RLHF முறையை மாற்றி, மனித முன்னுரிமை ஜோடிகளிலிருந்து நேரடியாகக் கற்கும் ஒரு ஒற்றை, நிலையான இழப்பு முறையை (loss) வழங்குகிறது. பயிற்சித் தரவு நீங்கள் விரும்பும் நடத்தைகளை உள்ளடக்கியிருந்தாலும் மற்றும் விலகல் அளவுருவை (drift parameter) நீங்கள் சரியாகக் கவனித்தாலும், மொழி மாதிரிகளைச் சீரமைப்பதற்கான ஒரு மலிவான மற்றும் மிகவும் கணிக்கக்கூடிய பாதையை இது வழங்குகிறது.
