Direct Preference Optimization (DPO) ഒരു പ്രത്യേക റിവാർഡ് മോഡൽ (reward model) പരിശീലിപ്പിക്കുകയോ റൈൻഫോഴ്സ്മെന്റ് ലേണിംഗ് (RL) ലൂപ്പ് പ്രവർത്തിപ്പിക്കുകയോ ചെയ്യാതെ തന്നെ ലാർജ് ലാംഗ്വേജ് മോഡലുകളെ ഫൈൻ ട്യൂൺ ചെയ്യാൻ ഡെവലപ്പർമാരെ അനുവദിക്കുന്നു. ഇത് കമ്പ്യൂട്ട് ചിലവും പരമ്പരാഗത RL-from-human-feedback പൈപ്പ്ലൈനുകളിൽ കാണാറുള്ള അസ്ഥിരതയും (instability) ഗണ്യമായി കുറയ്ക്കുന്നു.
എന്തുകൊണ്ടാണ് RL-from-Human-Feedback പ്രയാസകരമായി തോന്നുന്നത്
സാധാരണ RL-from-human-feedback (RLHF) രീതിയിൽ മൂന്ന് ഘട്ടങ്ങളുണ്ട്. ആദ്യമായി, ഒരു ക്യൂറേറ്റഡ് ഡാറ്റാസെറ്റ് ഉപയോഗിച്ച് ഒരു ബേസ് മോഡൽ ഫൈൻ ട്യൂൺ ചെയ്യുന്നു. അടുത്തതായി, ഔട്ട്പുട്ടുകളുടെ ജോഡികൾക്കിടയിലുള്ള മനുഷ്യന്റെ താൽപ്പര്യങ്ങൾ (human preference) പ്രവചിക്കാൻ ഒരു റിവാർഡ് മോഡൽ പഠിക്കുന്നു. അവസാനമായി, ഒറിജിനൽ മോഡലിനോട് അടുത്ത് നിൽക്കുന്നതോടൊപ്പം തന്നെ ഉയർന്ന റിവാർഡുകളിലേക്ക് പോളിസിയെ എത്തിക്കുന്നതിനായി പ്രോക്സിമൽ പോളിസി ഒപ്റ്റിമൈസേഷൻ (PPO) – ഒരു ക്ലാസിക് RL അൽഗോരിതം – പ്രായോഗികമായി നടപ്പിലാക്കുന്നു.
ഈ മൂന്ന് മോഡലുകളും ഒരേസമയം മെമ്മറിയിൽ നിലനിൽക്കേണ്ടതുണ്ട്, കൂടാതെ ഓരോ അപ്ഡേറ്റിലും പുതിയ ടെക്സ്റ്റ് സാമ്പിൾ ചെയ്യുന്ന ചിലവേറിയ ഒരു RL ലൂപ്പിന് ഇത് നിർബന്ധമാക്കുന്നു. പലപ്പോഴും, റിവാർഡിനെ "ഗെയിം" ചെയ്യാൻ (game the reward) പോളിസി പഠിച്ചെടുക്കുന്നതായും, പ്രോക്സിയിൽ നല്ല സ്കോർ ലഭിക്കുമെങ്കിലും ഉദ്ദേശിച്ച ഗുണനിലവാരം ഇല്ലാത്ത ഔട്ട്പുട്ടുകൾ നൽകുന്നതായും ടീമുകൾ കാണാറുണ്ട്. ഇതിന്റെ ഫലമായി ചിലവേറിയതും, ദുർബലവും, സ്കെയിൽ ചെയ്യാൻ പ്രയാസമുള്ളതുമായ ഒരു പൈപ്പ്ലൈൻ ഉണ്ടാകുന്നു.
DPO-യുടെ ആൾജിബ്രയിക് ഷോർട്ട്കട്ട് (algebraic shortcut)
DPO റിവാർഡ് മോഡലിനെ പൂർണ്ണമായും ഒഴിവാക്കുന്നു. ഒരു റഫറൻസ് മോഡലിൽ നിന്നുള്ള വ്യതിയാനത്തിന് പിഴവ് (penalizing divergence) ഏർപ്പെടുത്തുന്നതോടൊപ്പം പ്രതീക്ഷിച്ച റിവാർഡ് പരമാവധിയാക്കുക എന്ന RLHF ലക്ഷ്യത്തിന് ഒരു ക്ലോസ്ഡ്-ഫോം എക്സ്പ്രഷൻ (closed-form expression) ഉണ്ടെന്നതാണ് ഇതിലെ പ്രധാന നിരീക്ഷണം. ഗണിതശാസ്ത്രപരമായ ക്രമീകരണത്തിലൂടെ, ഏതൊരു ടോക്കണിനും ലഭിക്കുന്ന റിവാർഡ് എന്നത് പോളിസി നൽകുന്ന ലോഗ്-പ്രോബബിലിറ്റിയും (log-probability) റഫറൻസ് മോഡൽ നൽകുന്ന ലോഗ്-പ്രോബബിലിറ്റിയും തമ്മിലുള്ള വ്യത്യാസമായി മാറുന്നു.
പ്രായോഗികമായി ഇതിനർത്ഥം "റിവാർഡ്" പോളിസിക്ക് ഉള്ളിൽ തന്നെ നിലനിൽക്കുന്നു എന്നാണ്. ട്രെയിനിംഗ് എന്നത് പ്രിഫറൻസ് ജോഡികൾക്കായുള്ള (preference pairs) ഒരു സിംഗിൾ ക്ലാസിഫിക്കേഷൻ ലോസ്സിലേക്ക് (classification loss) ചുരുങ്ങുന്നു: ഒരു തിരഞ്ഞെടുത്ത മറുപടിയും (chosen response) നിരസിക്കപ്പെട്ട ഒന്നും (rejected one) നൽകിയാൽ, തിരഞ്ഞെടുത്ത ടെക്സ്റ്റിന് ഉയർന്ന പ്രോബബിലിറ്റി നൽകാൻ മോഡലിനെ പ്രേരിപ്പിക്കുന്നു. ഇതിൽ സാമ്പിളിംഗോ, PPO അപ്ഡേറ്റുകളോ, സൂക്ഷിച്ചു വെക്കാൻ അധിക മോഡലുകളോ ആവശ്യമില്ല.
പുതിയ ലോസ് (loss) എങ്ങനെയിരിക്കും
നിലവിലെ പോളിസിയിലുള്ള പ്രിയപ്പെട്ട ഉത്തരത്തിന്റെ ലോഗ്-പ്രോബബിലിറ്റിയും റഫറൻസ് മോഡലിലെ ലോഗ്-പ്രോബബിലിറ്റിയും തമ്മിൽ താരതമ്യം ചെയ്യുകയാണ് ലോസ് ചെയ്യുന്നത്, ഇതിനെ ഒരു ടെമ്പറേച്ചർ പോലെയുള്ള ഹൈപ്പർപാരാമീറ്റർ β ഉപയോഗിച്ച് സ്കെയിൽ ചെയ്യുന്നു. ഉയർന്ന β മൂല്യം പോളിസിയെ റഫറൻസിനോട് അടുത്ത് നിൽക്കാൻ നിർബന്ധിക്കുകയും ഫ്ലുവൻസിയും (fluency) സുരക്ഷയും നിലനിർത്തുകയും ചെയ്യുന്നു. കുറഞ്ഞ β മൂല്യം പോളിസിയെ കൂടുതൽ ദൂരേക്ക് മാറാൻ അനുവദിക്കുകയും തിരഞ്ഞെടുത്ത ഉത്തരത്തോടുള്ള താൽപ്പര്യം വർദ്ധിപ്പിക്കുകയും ചെയ്യുന്നു.
ഡെവലപ്പർമാർക്ക് പ്രയോജനപ്പെടുന്ന ഗുണങ്ങൾ
- റിവാർഡ് മോഡൽ ആവശ്യമില്ല – ഒരു പ്രത്യേക പ്രെഡിക്റ്ററിനായി അധികമായി ഹ്യൂമൻ ഫീഡ്ബാക്ക് ശേഖരിക്കേണ്ടതില്ല.
- ട്രെയിനിംഗിനിടെ സാമ്പിളിംഗ് ആവശ്യമില്ല – ഗ്രേഡിയന്റുകൾ (gradients) കണക്കാക്കാൻ മോഡൽ പുതിയ ടെക്സ്റ്റ് നിർമ്മിക്കേണ്ടതില്ല, ഇത് GPU സമയം ഗണ്യമായി കുറയ്ക്കുന്നു.
- സ്ഥിരത (Stability) – വ്യതിയാനത്തിന് കാരണമാകുന്ന ഉയർന്ന വേരിയൻസ് ഉള്ള RL ഗ്രേഡിയന്റുകൾക്ക് പകരം ഒരു സ്റ്റാൻഡേർഡ് ബൈനറി-ക്രോസ്-എൻട്രോപ്പി ലോസ് ഉപയോഗിക്കുന്നു.
- കാര്യക്ഷമത (Efficiency) – ഓരോ പ്രിഫറൻസ് ജോഡിക്കും ഒരു സിംഗിൾ ഗ്രേഡിയന്റ് സ്റ്റെപ്പ് മതിയാകും; PPO-യേക്കാൾ വളരെ കുറഞ്ഞ എപ്പോക്കുകളിൽ (epochs) ട്രെയിനിംഗ് പൂർത്തിയാകുന്നു.
ബെഞ്ച്മാർക്ക് പ്രിഫറൻസ് ഡാറ്റാസെറ്റുകളിൽ, വളരെ കുറഞ്ഞ കമ്പ്യൂട്ട് ബഡ്ജറ്റിൽ തന്നെ DPO, PPO-യുടെ പ്രകടനത്തിന് തുല്യമായോ അതിനേക്കാൾ മികച്ചതോ ആയ ഫലം നൽകുന്നതായി ആദ്യകാല പരീക്ഷണങ്ങൾ കാണിക്കുന്നു. ഈ ചിലവ് കുറഞ്ഞ ഗുണം കാരണമാണ് പല ഓപ്പൺ സോഴ്സ് പ്രോജക്റ്റുകളും DPO-യോ അതിനോട് അടുത്ത രൂപങ്ങളോ തങ്ങളുടെ ഡിഫോൾട്ട് അലൈൻമെന്റ് രീതിയായി സ്വീകരിച്ചിരിക്കുന്നത്.
പരിമിതികൾ (The trade-offs)
DPO ഒരു നിശ്ചിത പ്രിഫറൻസ് ജോഡികളിൽ (preference pairs) ആണ് പ്രവർത്തിക്കുന്നത്. ട്രെയിനിംഗിനിടെ പുതിയ ഉത്തരങ്ങൾ സാമ്പിൾ ചെയ്യാത്തതിനാൽ, ഒറിജിനൽ ഡാറ്റയിൽ ഇല്ലാത്ത ഉത്തരങ്ങൾ കണ്ടെത്താൻ ഇതിന് കഴിയില്ല. ഇതിനു വിപരീതമായി, ഒരു ഓൺലൈൻ PPO റൺ മോഡലിനെ നിരന്തരം പരിശോധിക്കുന്നതിലൂടെ പുതിയതും ഉയർന്ന റിവാർഡ് നൽകുന്നതുമായ പെരുമാറ്റങ്ങൾ കണ്ടെത്താൻ സഹായിക്കുന്നു.
β വളരെ കുറഞ്ഞ രീതിയിൽ ക്രമീകരിക്കുകയോ ട്രെയിനിംഗ് കൂടുതൽ സ്റ്റെപ്പുകൾക്കായി നടത്തുകയോ ചെയ്താൽ, പോളിസി റഫറൻസ് മോഡലിൽ നിന്ന് അകന്നുപോവുകയും ഫ്ലുവൻസി നഷ്ടപ്പെടുകയോ അനാവശ്യമായ പിശകുകൾ (artefacts) ഉണ്ടാവുകയോ ചെയ്തേക്കാം.
ചുരുക്കത്തിൽ (Takeaway)
Direct Preference Optimization, മൂന്ന് മോഡലുകൾ അടങ്ങുന്നതും RL-നെ അമിതമായി ആശ്രയിക്കുന്നതുമായ RLHF രീതിക്ക് പകരം, മനുഷ്യന്റെ പ്രിഫറൻസ് ജോഡികളിൽ നിന്ന് നേരിട്ട് പഠിക്കുന്ന ഒരു സിംഗിൾ, സ്റ്റേബിൾ ലോസ് (stable loss) ഉപയോഗിക്കുന്നു. ട്രെയിനിംഗ് ഡാറ്റ ആവശ്യമായ പെരുമാറ്റങ്ങൾ ഉൾക്കൊള്ളുന്നുണ്ടെന്നും നിങ്ങൾ ഡ്രിഫ്റ്റ് പാരാമീറ്റർ (drift parameter) നിയന്ത്രിക്കുന്നുണ്ടെന്നും ഉറപ്പാക്കിയാൽ, ലാംഗ്വേജ് മോഡലുകളെ അലൈൻ ചെയ്യുന്നതിനുള്ള കുറഞ്ഞ ചിലവുള്ളതും കൂടുതൽ പ്രവചിക്കാവുന്നതുമായ ഒരു മാർഗ്ഗമാണ് ഇതിലൂടെ ലഭിക്കുന്നത്.
