Waandishi wa karatasi ya SEED walifichua mbinu inayowaruhusu mawakala wa kujifunza kwa kuimarisha (RL) kugeuza kumbukumbu zao za kushindwa kuwa data mpya za mafunzo. Inainua alama za wastani kwenye kipimo cha ALFWorld hadi 91.8 na kupunguza kiasi cha data za mafunzo kwa takriban 40 %. Mbinu hiyo hiyo inaongeza ongezeko la pointi 15.3 kwenye kazi ambazo mawakala hawajawahi kuziona, ikithibitisha kuwa modeli inaweza kujifunza kutokana na makosa yake bila usimamizi wa ziada wa kibinadamu.

Kwa nini mawakala wa RL wanahitaji zaidi ya ishara ya kufaulu/kufeli

Mifumo ya kawaida ya RL humzawadia wakala tu mwishoni mwa kipindi (episode) kirefu. Ishara hiyo huambia mfumo kuwa matokeo yalikuwa makosa, lakini haisemi chochote kuhusu mahali ambapo kosa lilitokea. Ikiwa kosa lilitokea hatua kumi mapema—labda neno la utafutaji lisilo sahihi lilitolewa au faili isiyo sahihi ilifunguliwa—ishara ya mwisho ya binary hutupa taarifa zote za kati. Upotevu huo unawalazimu watafiti kukusanya idadi kubwa ya vipindi ili tu kutoa mifumo adimu inayopelekea kushindwa.

Jinsi SEED inavyobadilisha mzunguko wa mrejesho

SEED (Self-Evolving On-Policy Distillation) inaongeza hatua ya pili ya kujifunza baada ya kila kipindi:

  1. Maliza kazi – wakala huendesha hadi mwisho, akipokea lebo ya kawaida ya mafanikio/kushindwa.
  2. Soma nakala yake yenyewe – mfuatano wa vitendo, uchunguzi, na maamuzi ya kati hurejeshwa kwa modeli.
  3. Andika masomo kwa lugha ya asili – modeli hutengeneza sentensi fupi zinazoeleza nini kilichokwenda mrama, k.m., “neno la utafutaji ‘X’ lilirudisha matokeo yasiyohusika” au “alifungua faili ‘Y’ badala ya ‘Z’”.
  4. Chuja masomo kuwa maboresho ya sera (policy updates) – sentensi hizo zinakuwa lengo la hatua mpya ya uchujaji wa on-policy (on-policy distillation), ikifundisha modeli mantiki iliyo nyuma ya marekebisho hayo.

Masomo yaliyotengenezwa si maelekezo (prompts) yanayotumiwa wakati wa utendaji (inference); ni ishara za ndani za mafunzo zinazobadilisha sera. Kwa hakika, wakala anakuwa mwalimu wake mwenyewe, akigeuza kumbukumbu ghafi za kushindwa kuwa maarifa yaliyopangwa.

Ni nini kinachofanya mbinu hii kuwa na ufanisi zaidi kuliko mbinu za kumbukumbu

Njia ya kawaida ya kutatua tatizo hili ni kuunganisha mfumo wa kumbukumbu wa nje (external memory buffer) unaohifadhi hali muhimu au maelezo kwa ajili ya kukumbukwa baadaye. Mkakati huo unaunda "kabati la mafaili" kubwa ambapo wakala lazima ajifunze kutoa kipande sahihi kwa wakati sahihi—tatizo lisilo dogo ambalo huongeza mzigo wa kazi na bado linaweza kukosa uhusiano wa kisababishi kati ya kitendo na matokeo.

SEED huepuka tatizo la utafutaji. Kwa kuingiza somo moja kwa moja kwenye sera kupitia uchujaji (distillation), wakala huingiza marekebisho hayo kama ujuzi badala ya maelezo ya kutafutwa baadaye. Matokeo yake ni mzunguko thabiti zaidi kati ya ugunduzi wa kosa na mabadiliko ya tabia.

Takwimu muhimu

  • Kipimo cha ALFWorld – alama ya wastani ya 91.8, ikishinda misingi ya kawaida ya RL inayotumia mazingira yaleyale.
  • Ufanisi wa data – hufikia utendaji sawa au bora zaidi kwa takriban 40 % ya vipindi vichache vya mafunzo.
  • Uwezo wa kuenea (Generalization) – kwenye kazi ambazo hazijajulikana, mbinu hii inaongeza pointi 15.3 juu ya RL ya kawaida, ikionyesha kuwa masomo yanayozalishwa yenyewe yanakamata mifumo ya ufikiri inayoweza kuhamishwa.

Takwimu hizi zinaonyesha kuwa SEED inaweza kupunguza bajeti ya kompyuta na data kwa ajili ya kufundisha mawakala tata, jambo ambalo ni faida kubwa kwa timu zinazokosa rasilimali kubwa za uigizaji (simulation).

Hatari na mipaka

Mbinu hii inategemea uwezo wa modeli kutafsiri uzoefu wake wenyewe kwa usahihi. Ikiwa wakala atasoma mazingira vibaya—kwa mfano, akichukulia kushindwa kwa sababu isiyo sahihi—anaweza kutoa somo lisilo sahihi lakini lenye uhakika. Kufundishwa kwa ushauri huo wa kubuni (hallucinated advice) kunaweza kuimarisha tabia mbaya. Waandishi wanabainisha kuwa hii inafanana na uchambuzi wa baada ya tukio (post-mortems) kwa binadamu, ambapo wachambuzi wakati mwingine hutengeneza maelezo yaliyopangwa kupita kiasi ambayo huficha matatizo ya ndani zaidi.

Nini cha kufuatilia baadaye

  • Ujumuishaji na mifumo ya RL iliyopo – kwa sababu SEED inaongeza hatua ya usindikaji wa baada ya kipindi pekee, inaweza kuwekwa kwenye mifumo mingi ya mafunzo iliyopo kwa juhudi ndogo za uhandisi.

Watengenezaji wanaojenga mawakala wa RL wanapaswa kuanza kuchukulia kumbukumbu za vipindi (episode logs) kama zaidi ya data za uhifadhi tu. Baada ya kila mzunguko, iombe mfumo uonyeshe:

  • Uamuzi uliopiga hatua zaidi katika kazi hiyo.
  • Dhana iliyosababisha upotezaji mkubwa wa hatua.
  • Ukaguzi rahisi ambao ungeweza kukamata kosa mapema.

Badala ya kurudisha maelezo hayo kama maelekezo ya papo hapo (ad-hoc prompts), yaingize katika hatua ya uchujaji kama SEED inavyopendekeza. Faida yake ni wazi: utendaji bora, data kidogo, na modeli inayojifunza kuelezea makosa yake yenyewe.

Muhtasari: Kubadilisha kumbukumbu za kushindwa kuwa masomo yanayozalishwa yenyewe kunaweza kubadilisha mrejesho wa zawadi adimu kuwa ishara tajiri ya mafunzo inayoweza kutumika tena, ikitoa njia ya vitendo kuelekea RL ya haraka zaidi na inayotumia data kwa ufanisi zaidi.