Direct Preference Optimization (DPO) డెవలపర్‌లకు ఒక ప్రత్యేకమైన రివార్డ్ మోడల్‌ను ట్రైన్ చేయకుండా లేదా రీఇన్‌ఫోర్స్‌మెంట్-లెర్నింగ్ (RL) లూప్‌ను నడపకుండానే లార్జ్ లాంగ్వేజ్ మోడల్స్‌ను ఫైన్-ట్యూన్ చేసే వీలు కల్పిస్తుంది. ఇది కంప్యూట్ ఖర్చులను మరియు సాంప్రదాయ RL-from-human-feedback పైప్‌లైన్‌లలో తరచుగా ఎదురయ్యే అస్థిరతను (instability) గణనీయంగా తగ్గిస్తుంది.

RL-from-Human-Feedback ఎందుకు భారంగా అనిపిస్తుంది

ప్రామాణిక RL-from-human-feedback (RLHF) విధానంలో మూడు దశలు ఉంటాయి. మొదట, ఒక క్యూరేటెడ్ డేటాసెట్‌పై బేస్ మోడల్‌ను ఫైన్-ట్యూన్ చేస్తారు. తర్వాత, ఒక రివార్డ్ మోడల్ అవుట్‌పుట్‌ల జంటల మధ్య మానవ ప్రాధాన్యతను (human preference) అంచనా వేయడం నేర్చుకుంటుంది. చివరగా, ప్రాక్టీషనర్లు Proximal Policy Optimization (PPO) – ఇది ఒక క్లాసిక్ RL అల్గారిథమ్ – ను రన్ చేస్తారు. ఇది ఒరిజినల్ మోడల్‌కు దగ్గరగా ఉంటూనే, పాలసీని అధిక అంచనా వేయబడిన రివార్డ్‌ల వైపు నడిపిస్తుంది.

ఆ మూడు మోడళ్ల సెటప్ ఒకేసారి మెమరీలో ఉండటం వల్ల, ప్రతి అప్‌డేట్‌లో కొత్త టెక్స్ట్‌ను శాంపిల్ చేసే ఖరీదైన RL లూప్ అవసరమవుతుంది. పాలసీ తరచుగా రివార్డ్‌ను "గేమ్" (game) చేయడం నేర్చుకుంటుంది, అంటే ప్రాక్సీపై మంచి స్కోరు ఇచ్చే అవుట్‌పుట్‌లను ఉత్పత్తి చేస్తుంది కానీ ఉద్దేశించిన నాణ్యతను కోల్పోతుంది. దీని ఫలితంగా పైప్‌లైన్ ఖరీదైనదిగా, సున్నితమైనదిగా (fragile) మరియు స్కేల్ చేయడం కష్టంగా మారుతుంది.

DPO యొక్క ఆల్జీబ్రిక్ షార్ట్‌కట్

DPO రివార్డ్ మోడల్‌ను పూర్తిగా వదిలేస్తుంది. RLHF లక్ష్యం – అంటే రిఫరెన్స్ మోడల్ నుండి విచలనాన్ని (divergence) శిక్షించుకుంటూనే, ఆశించిన రివార్డ్‌ను గరిష్టీకరించడం – ఒక క్లోజ్డ్-ఫామ్ ఎక్స్‌ప్రెషన్‌ను కలిగి ఉంటుందనేదే ఇక్కడ కీలక అంశం. గణితాన్ని పునర్వ్యవస్థీకరించడం ద్వారా, ఏదైనా టోకెన్ యొక్క రివార్డ్ అనేది పాలసీ మరియు రిఫరెన్స్ మోడల్ కేటాయించిన log-probability మధ్య వ్యత్యాసంగా మారుతుంది.

ఆచరణలో దీని అర్థం "రివార్డ్" అనేది పాలసీలోనే ఉంటుంది. ట్రైనింగ్ అనేది ప్రాధాన్యత జంటలపై (preference pairs) ఒకే క్లాసిఫికేషన్ లాస్‌గా మారుతుంది: ఒక ఎంచుకోబడిన (chosen) ప్రతిస్పందన మరియు తిరస్కరించబడిన (rejected) ప్రతిస్పందన ఇచ్చినప్పుడు, మోడల్ ఎంచుకోబడిన టెక్స్ట్‌కు అధిక సంభావ్యతను (probability) కేటాయించేలా ప్రేరేపించబడుతుంది. ఇక్కడ శాంప్లింగ్ లేదు, PPO అప్‌డేట్‌లు లేవు, మరియు స్టోర్ చేయడానికి అదనపు మోడల్ అవసరం లేదు.

కొత్త లాస్ (loss) ఎలా ఉంటుంది

ఈ లాస్, ప్రస్తుత పాలసీ కింద ఉన్న ప్రిఫర్డ్ ఆన్సర్ యొక్క log-probabilityని, రిఫరెన్స్ మోడల్ కింద ఉన్న దానితో పోలుస్తుంది, దీనిని టెంపరేచర్ వంటి హైపర్ పారామీటర్ β ద్వారా స్కేల్ చేస్తారు. అధిక β విలువ పాలసీ రిఫరెన్స్‌కు దగ్గరగా ఉండేలా చేస్తుంది, తద్వారా ఫ్లూయెన్సీ (fluency) మరియు భద్రతను కాపాడుతుంది. తక్కువ β విలువ పాలసీని మరింత దూరంగా వెళ్లేలా అనుమతిస్తుంది, తద్వారా ఎంచుకోబడిన సమాధానం పట్ల దాని ప్రాధాన్యతను పెంచుతుంది.

డెవలపర్‌లకు ఉపయోగపడే ప్రయోజనాలు

  • రివార్డ్ మోడల్ అవసరం లేదు – ప్రత్యేక ప్రిడిక్టర్‌ కోసం అదనపు మానవ ఫీడ్‌బ్యాక్‌ను సేకరించాల్సిన అవసరం ఉండదు.
  • ట్రైనింగ్ సమయంలో శాంప్లింగ్ అవసరం లేదు – గ్రేడియంట్‌లను లెక్కించడానికి మోడల్ ఎప్పుడూ కొత్త టెక్స్ట్‌ను జనరేట్ చేయదు, దీనివల్ల GPU సమయం గణనీయంగా తగ్గుతుంది.
  • స్థిరత్వం (Stability) – అస్థిరతకు (divergence) కారణమయ్యే హై-వేరియెన్స్ RL గ్రేడియంట్‌లకు బదులుగా ప్రామాణిక binary-cross-entropy లాస్ ఉంటుంది.
  • సామర్థ్యం (Efficiency) – ప్రతి ప్రాధాన్యత జంటపై ఒకే గ్రేడియంట్ స్టెప్ సరిపోతుంది; PPO కంటే చాలా తక్కువ epochs లో ట్రైనింగ్ పూర్తవుతుంది.

ప్రారంభ ప్రయోగాలు చూపిస్తున్న దాని ప్రకారం, DPO చాలా తక్కువ కంప్యూట్ బడ్జెట్‌ను ఉపయోగిస్తూనే, బెంచ్‌మార్క్ ప్రాధాన్యత డేటాసెట్‌లపై PPO పనితీరుకు సమానంగా లేదా అంతకంటే మెరుగ్గా ఉంది. ఈ ఖర్చు ప్రయోజనం వల్లే చాలా ఓపెన్-సోర్స్ ప్రాజెక్ట్‌లు ఇప్పటికే DPO లేదా దానికి దగ్గరి వెర్షన్‌ను తమ డిఫాల్ట్ అలైన్‌మెంట్ పద్ధతిగా స్వీకరించాయి.

లాభనష్టాలు (Trade-offs)

DPO అనేది నిర్ణీత ప్రాధాన్యత జంటల (preference pairs) సెట్‌పై పనిచేస్తుంది. ట్రైనింగ్ సమయంలో ఇది కొత్త సమాధానాలను శాంపిల్ చేయదు కాబట్టి, అసలు డేటాలో లేని సమాధానాలను ఇది అన్వేషించలేదు. దీనికి విరుద్ధంగా, ఆన్‌లైన్ PPO రన్ మోడల్‌ను నిరంతరం పరీక్షించడం ద్వారా కొత్త మరియు అధిక రివార్డ్ ఇచ్చే ప్రవర్తనలను కనుగొనగలదు.

ఒకవేళ β చాలా తక్కువగా ఉంటే లేదా ట్రైనింగ్ చాలా ఎక్కువ స్టెప్స్ వరకు నడిస్తే, పాలసీ రిఫరెన్స్ మోడల్ నుండి విచలించి ఫ్లూయెన్సీని కోల్పోవచ్చు లేదా అనవసరమైన లోపాలను (artefacts) కలిగించవచ్చు.

ముగింపు (Takeaway)

Direct Preference Optimization అనేది మూడు మోడళ్లతో కూడిన, RL-భారీ RLHF స్టాక్‌కు బదులుగా, మానవ ప్రాధాన్యత జంటల నుండి నేరుగా నేర్చుకునే ఒకే ఒక స్థిరమైన లాస్‌ను అందిస్తుంది. దీని ఫలితంగా లాంగ్వేజ్ మోడల్స్‌ను అలైన్ చేయడానికి తక్కువ ఖర్చుతో కూడిన, మరింత ఊహించదగిన మార్గం లభిస్తుంది—అయితే ట్రైనింగ్ డేటా మీకు కావాల్సిన ప్రవర్తనలను కలిగి ఉండాలి మరియు మీరు డ్రిఫ్ట్ పారామీటర్‌ను నియంత్రణలో ఉంచాలి.