Direct Preference Optimization (DPO) inaruhusu watengenezaji kufanya fine-tuning ya mifumo mikubwa ya lugha (large language models) bila kuhitaji kufundisha mfumo mwingine wa zawadi (reward model) au kuendesha mzunguko wa kujifunza kwa kuimarisha (reinforcement-learning (RL) loop), jambo linalopunguza gharama za uchakataji na kutokuwa thabiti ambako mara nyingi hupata mifumo ya RL-from-human-feedback.

Kwa nini RL-from-Human-Feedback inahisi kuwa nzito

Kanuni ya kawaida ya RL-from-human-feedback (RLHF) ina hatua tatu. Kwanza, mfumo wa msingi (base model) unafanyiwa fine-tuning kwenye seti ya data iliyochujwa. Kisha, mfumo wa zawadi (reward model) unajifunza kutabiri upendeleo wa binadamu kati ya matokeo mawili. Mwishowe, watendaji huendesha Proximal Policy Optimization (PPO) – algoriti ya kawaida ya RL – ili kusukuma sera (policy) kuelekea zawadi kubwa zaidi iliyotabiriwa huku ikibaki karibu na mfumo wa awali.

Mpangilio huo wa mifumo mitatu unakaa kwenye kumbukumbu (memory) kwa wakati mmoja na kulazimisha mzunguko wa gharama kubwa wa RL unaochukua sampuli za maandishi mapya kila wakati unapofanya maboresho. Timu mara nyingi huona sera ikijifunza "kudanganya" mfumo wa zawadi, ikitoa matokeo yanayopata alama nzuri kwenye mfano wa proxy lakini hayafikii ubora unaokusudiwa. Matokeo yake ni mfumo ambao ni ghali, dhaifu, na mgumu kupanua (scale).

Njia ya mkato ya kialjebra ya DPO

DPO inaacha mfumo wa zawadi (reward model) kabisa. Uchunguzi muhimu ni kwamba lengo la RLHF – kuongeza zawadi inayotarajiwa huku ukipunguza uwezekano wa kutofautiana na mfumo wa rejeleo (reference model) – lina usemi wa kielelezo (closed-form expression). Kwa kupanga upya hisabati hiyo, zawadi kwa token yoyote inakuwa tofauti kati ya log-probability iliyotolewa na sera (policy) na ile iliyotolewa na mfumo wa rejeleo.

Katika vitendo, hii inamaanisha "zawadi" inapatikana ndani ya sera yenyewe. Mafunzo yanapunguzwa kuwa hasara moja ya uainishaji (classification loss) kwenye jozi za upendeleo: ikitolewa jibu lililochaguliwa na lile lililokataliwa, mfumo unahimizwa kutoa uwezekano mkubwa zaidi kwa maandishi yaliyochaguliwa. Hakuna sampuli, hakuna maboresho ya PPO, hakuna mfumo wa ziada wa kuhifadhi.

Jinsi hasara (loss) mpya inavyoonekana

Hasara (loss) inalinganisha log-probability ya jibu linalopendekezwa chini ya sera ya sasa na ile ya mfumo wa rejeleo, ikiongezewa na hyperparameter β inayofanana na joto (temperature). β kubwa inalazimisha sera kubaki karibu na rejeleo, ikihifadhi ufasaha na usalama. β ndogo inaruhusu sera kusogea mbali zaidi, ikiongeza ukali wa upendeleo wake kwa jibu lililochaguliwa.

Faida zinazojali watengenezaji

  • Hakuna mfumo wa zawadi – inaondoa hitaji la kukusanya maoni ya ziada ya binadamu kwa ajili ya mtabiri (predictor) tofauti.
  • Hakuna sampuli wakati wa mafunzo – mfumo hauzalishi maandishi mapya kamwe ili kupiga hesabu za gradienti, jambo linalopunguza muda wa GPU kwa kiasi kikubwa.
  • Utulivu – hasara ya kawaida ya binary-cross-entropy inachukua nafasi ya gradienti za RL zenye mabadiliko makubwa (high-variance) ambazo mara nyingi husababisha kutokuwa thabiti.
  • Ufanisi – hatua moja ya gradient kwenye kila jozi ya upendeleo inatosha; mafunzo hukamilika kwa epochs chache zaidi kuliko PPO.

Majaribio ya awali yanaonyesha DPO kufikia au kuzidi utendaji wa PPO kwenye seti za data za kigezo (benchmark) huku ikitumia sehemu ndogo tu ya bajeti ya uchakataji. Faida hiyo ya gharama inaeleza kwa nini miradi mingi ya chanzo huru (open-source) tayari imekubali DPO au toleo linalokaribiana nalo kama njia yao ya kawaida ya ulinganishaji (alignment).

Mabadilishano (Trade-offs)

DPO hufanya kazi kwenye seti maalum ya jozi za upendeleo. Kwa sababu haichukui sampuli za maelezo mapya wakati wa mafunzo, haiwezi kuchunguza maeneo ya majibu ambayo hayakuwepo kwenye data ya awali. Kinyume chake, uendeshaji wa PPO unaweza kugundua tabia mpya zenye zawadi kubwa zaidi kwa kuchunguza mfumo mara kwa mara.

Ikiwa β imewekwa kuwa ndogo sana au mafunzo yanaendelea kwa hatua nyingi sana, sera inaweza kusogea mbali na mfumo wa rejeleo kiasi cha kupoteza ufasaha au kuleta vitu visivyohitajika (artefacts).

Hitimisho

Direct Preference Optimization inachukua mfumo wa RLHF wenye mifumo mitatu na mzito wa RL na kuubadilisha kuwa hasara moja thabiti inayojifunza moja kwa moja kutoka kwa jozi za upendeleo za binadamu. Matokeo yake ni njia rahisi na inayotabirika zaidi ya kuoanisha mifumo ya lugha—mradi tu data ya mafunzo inakamata tabia unazohitaji na unadhibiti parameter ya kusogea (drift parameter).