Direct Preference Optimization (DPO) ડેવલપર્સને અલગ રિવોર્ડ મોડલ (reward model) તાલીમ આપ્યા વગર અથવા રિઇન્ફોર્સમેન્ટ-લર્નિંગ (RL) લૂપ ચલાવ્યા વગર લાર્જ લેંગ્વેજ મોડલ્સને ફાઇન-ટ્યુન કરવાની મંજૂરી આપે છે, જેનાથી કમ્પ્યુટિંગ ખર્ચ અને પરંપરાગત RL-from-human-feedback પાઇપલાઇન્સમાં જોવા મળતી અસ્થિરતા બંનેમાં ઘટાડો થાય છે.
શા માટે RL-from-Human-Feedback ભારે લાગે છે
પ્રમાણભૂત RL-from-human-feedback (RLHF) પ્રક્રિયામાં ત્રણ તબક્કા હોય છે. પ્રથમ, એક બેઝ મોડલને ક્યુરેટેડ ડેટાસેટ પર ફાઇન-ટ્યુન કરવામાં આવે છે. ત્યારબાદ, એક રિવોર્ડ મોડલ આઉટપુટની જોડી વચ્ચે માનવીય પસંદગીની આગાહી કરવાનું શીખે છે. અંતે, પ્રેક્ટિશનર્સ Proximal Policy Optimization (PPO) – જે એક ક્લાસિક RL અલ્ગોરિધમ છે – ચલાવે છે, જેથી ઓરિજિનલ મોડલની નજીક રહેતા જ પોલિસીને ઉચ્ચ અનુમાનિત રિવોર્ડ્સ તરફ ધકેલી શકાય.
આ ત્રણ-મોડલ સેટઅપ મેમરીમાં એકસાથે રહે છે અને દરેક અપડેટ પર નવો ટેક્સ્ટ સેમ્પલ કરવા માટે ખર્ચાળ RL લૂપ ફરજિયાત બનાવે છે. ટીમો ઘણીવાર જુએ છે કે પોલિસી રિવોર્ડને “ગેમ” (game) કરતા શીખી જાય છે, એટલે કે એવા આઉટપુટ્સ બનાવે છે જે પ્રોક્સી પર સારું સ્કોર કરે છે પરંતુ નિર્ધારિત ગુણવત્તા ધરાવતા નથી. પરિણામે, પાઇપલાઇન ખર્ચાળ, નાજુક અને સ્કેલ કરવામાં મુશ્કેલ બને છે.
DPO ની આલ્જેબ્રિક શોર્ટકટ
DPO રિવોર્ડ મોડલને સંપૂર્ણપણે છોડી દે છે. મુખ્ય અવલોકન એ છે કે RLHF ઉદ્દેશ્ય – રેફરન્સ મોડલથી વિચલન (divergence) ને પેનલાઇઝ કરીને અપેક્ષિત રિવોર્ડને મહત્તમ બનાવવો – તેનું ક્લોઝ્ડ-ફોર્મ એક્સપ્રેશન (closed-form expression) ઉપલબ્ધ છે. ગણિતને ફરીથી ગોઠવીને, કોઈપણ ટોકન માટેનું રિવોર્ડ પોલિસી દ્વારા આપવામાં આવેલી લોગ-પ્રોબેબિલિટી (log-probability) અને રેફરન્સ મોડલ દ્વારા આપવામાં આવેલી લોગ-પ્રોબેબિલિટી વચ્ચેનો તફાવત બની જાય છે.
વ્યવહારમાં આનો અર્થ એ છે કે “રિવોર્ડ” પોલિસીની અંદર જ રહે છે. તાલીમ (training) પસંદગીની જોડીઓ પર સિંગલ ક્લાસિફિકેશન લોસ (classification loss) માં પરિવર્તિત થાય છે: પસંદ કરેલ પ્રતિસાદ અને નકારવામાં આવેલ પ્રતિસાદ આપેલ હોય ત્યારે, મોડલને પસંદ કરેલા ટેક્સ્ટને ઉચ્ચ સંભાવના (probability) આપવા માટે પ્રોત્સાહિત કરવામાં આવે છે. કોઈ સેમ્પલિંગ નહીં, કોઈ PPO અપડેટ્સ નહીં, અને સ્ટોર કરવા માટે કોઈ વધારાનું મોડલ નહીં.
નવો લોસ (loss) કેવો દેખાય છે
આ લોસ વર્તમાન પોલિસી હેઠળના પસંદગીના જવાબની લોગ-પ્રોબેબિલિટીની સરખામણી રેફરન્સ મોડલ હેઠળની લોગ-પ્રોબેબિલિટી સાથે કરે છે, જેને ટેમ્પરેચર જેવા હાઈપરપેરામીટર β દ્વારા સ્કેલ કરવામાં આવે છે. ઉચ્ચ β પોલિસીને રેફરન્સની નજીક રહેવા માટે મજબૂર કરે છે, જેનાથી પ્રવાહિતા (fluency) અને સુરક્ષા જળવાય છે. નીચું β પોલિસીને વધુ દૂર જવા દે છે, જેનાથી પસંદ કરેલા જવાબ માટે તેની પસંદગી વધુ સ્પષ્ટ બને છે.
ડેવલપર્સ માટે મહત્વના ફાયદાઓ
- કોઈ રિવોર્ડ મોડલ નહીં – અલગ પ્રિડિક્ટર માટે વધારાનો માનવીય પ્રતિસાદ એકત્રિત કરવાની જરૂરિયાત દૂર કરે છે.
- તાલીમ દરમિયાન કોઈ સેમ્પલિંગ નહીં – મોડલ ગ્રેડિયન્ટ્સની ગણતરી કરવા માટે ક્યારેય નવો ટેક્સ્ટ જનરેટ કરતું નથી, જેનાથી GPU સમયમાં મોટો ઘટાડો થાય છે.
- સ્થિરતા – એક પ્રમાણભૂત બાઈનરી-ક્રોસ-એન્ટ્રોપી લોસ (binary-cross-entropy loss) હાઈ-વેરિયન્સ RL ગ્રેડિયન્ટ્સનું સ્થાન લે છે જે ઘણીવાર વિચલન (divergence) નું કારણ બને છે.
- કાર્યક્ષમતા – દરેક પસંદગીની જોડી પર સિંગલ ગ્રેડિયન્ટ સ્ટેપ પૂરતું છે; તાલીમ PPO કરતા ઘણા ઓછા ઇપોક્સ (epochs) માં પૂર્ણ થાય છે.
પ્રારંભિક પ્રયોગો દર્શાવે છે કે DPO કમ્પ્યુટ બજેટના માત્ર એક નાના ભાગનો ઉપયોગ કરીને બેન્ચમાર્ક પ્રેફરન્સ ડેટાસેટ્સ પર PPO ની સરખામણીમાં અથવા તેનાથી વધુ સારું પ્રદર્શન કરે છે. આ ખર્ચનો ફાયદો સમજાવે છે કે શા માટે ઘણા ઓપન-સોર્સ પ્રોજેક્ટ્સ પહેલેથી જ DPO અથવા તેના જેવા જ કોઈ વિકલ્પને તેમની ડિફોલ્ટ એલાઈનમેન્ટ પદ્ધતિ તરીકે અપનાવી લીધા છે.
ટ્રેડ-ઓફ્સ (Trade-offs)
DPO પસંદગીની જોડીઓના નિશ્ચિત સેટ પર કામ કરે છે. તાલીમ દરમિયાન તે ક્યારેય નવા કમ્પ્લીશન્સ (completions) સેમ્પલ કરતું નથી, તેથી તે મૂળ ડેટામાં ન હોય તેવા જવાબના સ્પેસને એક્સપ્લોર કરી શકતું નથી. તેનાથી વિપરીત, ઓનલાઇન PPO રન મોડલને સતત તપાસીને નવા, ઉચ્ચ-રિવોર્ડ વર્તનો શોધી શકે છે.
જો β ખૂબ ઓછું સેટ કરવામાં આવે અથવા તાલીમ ઘણા વધુ સ્ટેપ્સ માટે ચાલે, તો પોલિસી રેફરન્સ મોડલથી એટલી દૂર જઈ શકે છે કે પ્રવાહિતા ગુમાવી દે અથવા અણિચ્છનીય આર્ટિફેક્ટ્સ (artefacts) પેદા કરે.
સારાંશ
Direct Preference Optimization ત્રણ-મોડલ અને RL-ભારે RLHF સ્ટેકને બદલે એક સિંગલ, સ્ટેબલ લોસ લાવે છે જે સીધું માનવીય પસંદગીની જોડીઓમાંથી શીખે છે. પરિણામ એ છે કે લેંગ્વેજ મોડલ્સને એલાઈન કરવા માટે સસ્તો અને વધુ અનુમાનિત માર્ગ મળે છે—જો તાલીમ ડેટા તમારી જરૂરિયાત મુજબના વર્તનોને કેપ્ચર કરે અને તમે ડ્રિફ્ટ પેરામીટરને નિયંત્રણમાં રાખો.
