Direct Preference Optimization (DPO) డెవలపర్లకు ఒక ప్రత్యేకమైన రివార్డ్ మోడల్ను ట్రైన్ చేయకుండా లేదా రీఇన్ఫోర్స్మెంట్-లెర్నింగ్ (RL) లూప్ను నడపకుండానే లార్జ్ లాంగ్వేజ్ మోడల్స్ను ఫైన్-ట్యూన్ చేసే వీలు కల్పిస్తుంది. ఇది కంప్యూట్ ఖర్చులను మరియు సాంప్రదాయ RL-from-human-feedback పైప్లైన్లలో తరచుగా ఎదురయ్యే అస్థిరతను (instability) గణనీయంగా తగ్గిస్తుంది.
RL-from-Human-Feedback ఎందుకు భారంగా అనిపిస్తుంది
ప్రామాణిక RL-from-human-feedback (RLHF) విధానంలో మూడు దశలు ఉంటాయి. మొదట, ఒక క్యూరేటెడ్ డేటాసెట్పై బేస్ మోడల్ను ఫైన్-ట్యూన్ చేస్తారు. తర్వాత, ఒక రివార్డ్ మోడల్ అవుట్పుట్ల జంటల మధ్య మానవ ప్రాధాన్యతను (human preference) అంచనా వేయడం నేర్చుకుంటుంది. చివరగా, ప్రాక్టీషనర్లు Proximal Policy Optimization (PPO) – ఇది ఒక క్లాసిక్ RL అల్గారిథమ్ – ను రన్ చేస్తారు. ఇది ఒరిజినల్ మోడల్కు దగ్గరగా ఉంటూనే, పాలసీని అధిక అంచనా వేయబడిన రివార్డ్ల వైపు నడిపిస్తుంది.
ఆ మూడు మోడళ్ల సెటప్ ఒకేసారి మెమరీలో ఉండటం వల్ల, ప్రతి అప్డేట్లో కొత్త టెక్స్ట్ను శాంపిల్ చేసే ఖరీదైన RL లూప్ అవసరమవుతుంది. పాలసీ తరచుగా రివార్డ్ను "గేమ్" (game) చేయడం నేర్చుకుంటుంది, అంటే ప్రాక్సీపై మంచి స్కోరు ఇచ్చే అవుట్పుట్లను ఉత్పత్తి చేస్తుంది కానీ ఉద్దేశించిన నాణ్యతను కోల్పోతుంది. దీని ఫలితంగా పైప్లైన్ ఖరీదైనదిగా, సున్నితమైనదిగా (fragile) మరియు స్కేల్ చేయడం కష్టంగా మారుతుంది.
DPO యొక్క ఆల్జీబ్రిక్ షార్ట్కట్
DPO రివార్డ్ మోడల్ను పూర్తిగా వదిలేస్తుంది. RLHF లక్ష్యం – అంటే రిఫరెన్స్ మోడల్ నుండి విచలనాన్ని (divergence) శిక్షించుకుంటూనే, ఆశించిన రివార్డ్ను గరిష్టీకరించడం – ఒక క్లోజ్డ్-ఫామ్ ఎక్స్ప్రెషన్ను కలిగి ఉంటుందనేదే ఇక్కడ కీలక అంశం. గణితాన్ని పునర్వ్యవస్థీకరించడం ద్వారా, ఏదైనా టోకెన్ యొక్క రివార్డ్ అనేది పాలసీ మరియు రిఫరెన్స్ మోడల్ కేటాయించిన log-probability మధ్య వ్యత్యాసంగా మారుతుంది.
ఆచరణలో దీని అర్థం "రివార్డ్" అనేది పాలసీలోనే ఉంటుంది. ట్రైనింగ్ అనేది ప్రాధాన్యత జంటలపై (preference pairs) ఒకే క్లాసిఫికేషన్ లాస్గా మారుతుంది: ఒక ఎంచుకోబడిన (chosen) ప్రతిస్పందన మరియు తిరస్కరించబడిన (rejected) ప్రతిస్పందన ఇచ్చినప్పుడు, మోడల్ ఎంచుకోబడిన టెక్స్ట్కు అధిక సంభావ్యతను (probability) కేటాయించేలా ప్రేరేపించబడుతుంది. ఇక్కడ శాంప్లింగ్ లేదు, PPO అప్డేట్లు లేవు, మరియు స్టోర్ చేయడానికి అదనపు మోడల్ అవసరం లేదు.
కొత్త లాస్ (loss) ఎలా ఉంటుంది
ఈ లాస్, ప్రస్తుత పాలసీ కింద ఉన్న ప్రిఫర్డ్ ఆన్సర్ యొక్క log-probabilityని, రిఫరెన్స్ మోడల్ కింద ఉన్న దానితో పోలుస్తుంది, దీనిని టెంపరేచర్ వంటి హైపర్ పారామీటర్ β ద్వారా స్కేల్ చేస్తారు. అధిక β విలువ పాలసీ రిఫరెన్స్కు దగ్గరగా ఉండేలా చేస్తుంది, తద్వారా ఫ్లూయెన్సీ (fluency) మరియు భద్రతను కాపాడుతుంది. తక్కువ β విలువ పాలసీని మరింత దూరంగా వెళ్లేలా అనుమతిస్తుంది, తద్వారా ఎంచుకోబడిన సమాధానం పట్ల దాని ప్రాధాన్యతను పెంచుతుంది.
డెవలపర్లకు ఉపయోగపడే ప్రయోజనాలు
- రివార్డ్ మోడల్ అవసరం లేదు – ప్రత్యేక ప్రిడిక్టర్ కోసం అదనపు మానవ ఫీడ్బ్యాక్ను సేకరించాల్సిన అవసరం ఉండదు.
- ట్రైనింగ్ సమయంలో శాంప్లింగ్ అవసరం లేదు – గ్రేడియంట్లను లెక్కించడానికి మోడల్ ఎప్పుడూ కొత్త టెక్స్ట్ను జనరేట్ చేయదు, దీనివల్ల GPU సమయం గణనీయంగా తగ్గుతుంది.
- స్థిరత్వం (Stability) – అస్థిరతకు (divergence) కారణమయ్యే హై-వేరియెన్స్ RL గ్రేడియంట్లకు బదులుగా ప్రామాణిక binary-cross-entropy లాస్ ఉంటుంది.
- సామర్థ్యం (Efficiency) – ప్రతి ప్రాధాన్యత జంటపై ఒకే గ్రేడియంట్ స్టెప్ సరిపోతుంది; PPO కంటే చాలా తక్కువ epochs లో ట్రైనింగ్ పూర్తవుతుంది.
ప్రారంభ ప్రయోగాలు చూపిస్తున్న దాని ప్రకారం, DPO చాలా తక్కువ కంప్యూట్ బడ్జెట్ను ఉపయోగిస్తూనే, బెంచ్మార్క్ ప్రాధాన్యత డేటాసెట్లపై PPO పనితీరుకు సమానంగా లేదా అంతకంటే మెరుగ్గా ఉంది. ఈ ఖర్చు ప్రయోజనం వల్లే చాలా ఓపెన్-సోర్స్ ప్రాజెక్ట్లు ఇప్పటికే DPO లేదా దానికి దగ్గరి వెర్షన్ను తమ డిఫాల్ట్ అలైన్మెంట్ పద్ధతిగా స్వీకరించాయి.
లాభనష్టాలు (Trade-offs)
DPO అనేది నిర్ణీత ప్రాధాన్యత జంటల (preference pairs) సెట్పై పనిచేస్తుంది. ట్రైనింగ్ సమయంలో ఇది కొత్త సమాధానాలను శాంపిల్ చేయదు కాబట్టి, అసలు డేటాలో లేని సమాధానాలను ఇది అన్వేషించలేదు. దీనికి విరుద్ధంగా, ఆన్లైన్ PPO రన్ మోడల్ను నిరంతరం పరీక్షించడం ద్వారా కొత్త మరియు అధిక రివార్డ్ ఇచ్చే ప్రవర్తనలను కనుగొనగలదు.
ఒకవేళ β చాలా తక్కువగా ఉంటే లేదా ట్రైనింగ్ చాలా ఎక్కువ స్టెప్స్ వరకు నడిస్తే, పాలసీ రిఫరెన్స్ మోడల్ నుండి విచలించి ఫ్లూయెన్సీని కోల్పోవచ్చు లేదా అనవసరమైన లోపాలను (artefacts) కలిగించవచ్చు.
ముగింపు (Takeaway)
Direct Preference Optimization అనేది మూడు మోడళ్లతో కూడిన, RL-భారీ RLHF స్టాక్కు బదులుగా, మానవ ప్రాధాన్యత జంటల నుండి నేరుగా నేర్చుకునే ఒకే ఒక స్థిరమైన లాస్ను అందిస్తుంది. దీని ఫలితంగా లాంగ్వేజ్ మోడల్స్ను అలైన్ చేయడానికి తక్కువ ఖర్చుతో కూడిన, మరింత ఊహించదగిన మార్గం లభిస్తుంది—అయితే ట్రైనింగ్ డేటా మీకు కావాల్సిన ప్రవర్తనలను కలిగి ఉండాలి మరియు మీరు డ్రిఫ్ట్ పారామీటర్ను నియంత్రణలో ఉంచాలి.
