એક નવું “proactive memory” મોડ્યુલ લાર્જ-લેંગ્વેજ-મોડલ એજન્ટ્સને મુખ્ય મોડલનું fine-tuning કર્યા વિના કાર્યની જરૂરિયાતો, પર્યાવરણના તથ્યો અને ભૂતકાળની નિષ્ફળતાઓ પર નજર રાખવાની મંજૂરી આપે છે. બેન્ચમાર્ક ટેસ્ટમાં, આ ઉમેરાને Terminal-Bench 2.0 પર Sonnet 4.5 ના સ્કોરમાં 8.3 ટકાકીય પોઈન્ટ્સ અને τ2-Bench સૂટ પર 6.8 પોઈન્ટ્સનો વધારો કર્યો; SETA-તાલીમ પામેલા મેમરી એજન્ટે અજાણ્યા પ્રશ્નો પર ફ્રોઝન મોડલના pass@1 ને 37.6% થી વધારીને 41.1% કરી દીધું.

એજન્ટ્સ કેમ પોતાનો માર્ગ ભૂલી જાય છે

જ્યારે LLM-સંચાલિત એજન્ટ બહુ-પગલાંની પ્રક્રિયા અનુસરે છે, ત્યારે તેની આંતરિક “state” ક્ષીણ થાય છે. સંશોધકો આને “behavioral state decay” કહે છે: મોડલ અગાઉની સૂચનાઓ, મુખ્ય તથ્યો અથવા તે પહેલેથી જ કરેલી ભૂલો ભૂલી જાય છે. પરિણામે ખરાબ નિર્ણયોની એક શ્રેણી સર્જાય છે જે કાર્ય પૂર્ણ થયાના ઘણા સમય પહેલાં જ તેને અધવચ્ચેથી અટકાવી દે છે.

સામાન્ય ઉપાય context window ને મોટું કરવાનો છે—એટલે કે લખાણનો એવો ભાગ જેના પર મોડલ એકસાથે ધ્યાન આપી શકે. તે માત્ર ત્યાં સુધી જ મદદ કરે છે જ્યાં સુધી કાર્ય વિન્ડો કરતા મોટું ન થઈ જાય; જૂની માહિતી દૂર કરવામાં આવે છે અને ક્ષીણ થવાની પ્રક્રિયા ફરી શરૂ થાય છે.

જરૂર પડે ત્યારે જ કાર્ય કરે તેવી રીમાઇન્ડર સિસ્ટમ

આ નવો અભિગમ એક હળવા (lightweight) સહાયક મેમરી એજન્ટ ઉમેરે છે જે મુખ્ય મોડલના રીઝનિંગ ટ્રેસ પર નજર રાખે છે અને લક્ષિત રીમાઇન્ડર્સ આપે છે. ભૂતકાળના સ્નિપેટ્સની સ્થિર યાદી ખેંચવાને બદલે, મેમરી મોડ્યુલ નક્કી કરે છે કે ક્યારે અને શું રજૂ કરવું, અને તે ત્યારે જ કાર્ય કરે છે જ્યારે મુખ્ય મોડલ વિચલિત થતું હોય તેવું લાગે.

કારણ કે મેમરી લર્નર અલગથી તાલીમ પામે છે, તેથી પ્રાથમિક એક્શન મોડલ ફ્રોઝન રહે છે. અભ્યાસ દર્શાવે છે કે આ અલગતા લાંબા ગાળાના (long-horizon) બેન્ચમાર્ક પર નોંધપાત્ર લાભ આપે છે, જે સાબિત કરે છે કે proactive રીમાઇન્ડર્સ મર્યાદિત context window ની ભરપાઈ કરી શકે છે.

આંકડા શું કહે છે

  • Terminal-Bench 2.0: Sonnet 4.5 તેના બેઝલાઇન કરતા 8.3 પોઈન્ટ્સ ઉપર જાય છે.
  • τ2-Bench suite: તે જ મોડલમાં 6.8 પોઈન્ટ્સનો સુધારો થાય છે.
  • Held-out ટેસ્ટ પર Pass@1: SETA-તાલીમ પામેલો મેમરી એજન્ટ ફ્રોઝન મોડલને 37.6% થી વધારીને 41.1% કરે છે.

આ વધારો મુખ્ય મોડલના કોઈપણ વધારાના fine-tuning વગર થાય છે, તેથી મેમરી ઘટકને હાલના ડિપ્લોયમેન્ટ્સમાં ઉમેરી કે હટાવી શકાય છે.

વર્તમાન કાર્યની મર્યાદાઓ

પ્રયોગો નીચેના પરીક્ષણો કરવા સુધી પહોંચ્યા નથી:

  • Scale: હજુ સુધી એવા કોઈ પુરાવા નથી કે મેમરી મોડ્યુલ મલ્ટી-બિલિયન-પેરામીટર મોડલ્સ અથવા લાખો સ્ટેપ્સ સુધી ચાલતા કાર્યો સાથે પણ આ જ રીતે વર્તે છે.
  • Production cost: રીમાઇન્ડર્સનો સંગ્રહ અને પુનઃપ્રાપ્તિ વધારાનો બોજ (overhead) ઉમેરે છે, પરંતુ અભ્યાસ વાસ્તવિક વિશ્વની સિસ્ટમમાં જરૂરી વધારાની મેમરી અથવા કમ્પ્યુટિંગ ક્ષમતાનું પ્રમાણ દર્શાવતો નથી.

આગળ શું જોવું

ભવિષ્યના બેન્ચમાર્ક સૂટ્સ માટે માત્ર કાચા (raw) context size કરતા વધુ માપદંડોની જરૂર પડશે. જે પરીક્ષણો સ્પષ્ટપણે state decay ને ટ્રેક કરે છે અને સક્રિય રીમાઇન્ડર સિસ્ટમ્સને પ્રોત્સાહન આપે છે, તે એજન્ટની લાંબા ગાળાની વિશ્વસનીયતાનું સ્પષ્ટ ચિત્ર આપશે. સંશોધકોએ એ પણ દર્શાવવું પડશે કે proactive memory મોડલના કદ અને ઓપરેશનલ ખર્ચ બંનેમાં કાર્યક્ષમ રીતે સ્કેલ થાય છે.

Takeaway: એક નાનું, અલગથી તાલીમ પામેલું મેમરી મોડ્યુલ લાર્જ-લેંગ્વેજ-મોડલ એજન્ટ્સ માટે વોચડોગ તરીકે કામ કરી શકે છે, જે કાર્યને ખોટા માર્ગે લઈ જતા પહેલા જ વિચલન (drift) ને પકડી શકે છે અને સુધારી શકે છે.