સ્ટ્રક્ચર્ડ મેમરી કેવી રીતે AI એજન્ટ્સને Slay the Spire 2 જીતવામાં મદદ કરે છે
સંશોધકોએ એક નવું એજન્ટિક આર્કિટેક્ચર, AgenticSTS વિકસાવ્યું છે, જે અતિશય મોટા ચેટ લોગ્સને બદલે એક અત્યાધુનિક પાંચ-સ્તરીય સ્ટ્રક્ચર્ડ મેમરી સિસ્ટમનો ઉપયોગ કરીને પરંપરાગત LLM એજન્ટો કરતા વધુ સારું પ્રદર્શન કરે છે. "વધતા જતા ટ્રાન્સક્રિપ્ટ" (growing transcript) મોડેલથી દૂર જઈને, આ અભિગમ ટોકન ખર્ચમાં નોંધપાત્ર ઘટાડો કરે છે અને સાથે જ એજન્ટોને અનેક રમત રમતી વખતે જટિલ વ્યૂહરચનાઓ શીખવામાં સક્ષમ બનાવે છે.
વધતા જતા ચેટ લોગ્સ સાથેની સમસ્યા
મોટાભાગના વર્તમાન LLM એજન્ટો, જેમ કે ReAct અથવા Reflexion ફ્રેમવર્કનો ઉપયોગ કરતા એજન્ટો, દરેક ભૂતકાળના અવલોકન, ટૂલ કોલ અને સ્વ-ચિંતન (self-reflection) ને સતત ટેક્સ્ટ લોગમાં ઉમેરવા પર આધાર રાખે છે. જેમ જેમ સત્ર આગળ વધે છે, તેમ તેમ આ કોન્ટેક્સ્ટ વિન્ડો વધતી જાય છે જ્યાં સુધી તે ઓવરફ્લો ન થાય અથવા મોડેલનું ધ્યાન અપ્રસ્તુત ઐતિહાસિક ડેટા દ્વારા વિખેરાઈ ન જાય.
જટિલ ડેક-બિલ્ડિંગ રોગલાઈક (roguelike) Slay the Spire 2 સામેના પરીક્ષણમાં, આ બિનકાર્યક્ષમતા સ્પષ્ટપણે જોવા મળી હતી. STS2MCP અને CharTyr જેવા સ્પર્ધકો, જે ક્લાસિક ગ્રોઈંગ-ટ્રાન્સક્રિપ્ટ પેટર્નનો ઉપયોગ કરે છે, તેમાં સિંગલ મોડેલ કોલ્સ અંદાજે 527,000 ટોકન્સ સુધી પહોંચી ગયા હતા. આ આર્કિટેક્ચરલ ખામીને કારણે મોટું લેટન્સી (latency) અને આસમાની ટોકન ખર્ચ થાય છે, જેમાં સ્પર્ધકો સમાન સ્કોર મેળવવા માટે AgenticSTS કરતા 66 થી 90 ગણા વધુ ટોકન્સનો ઉપયોગ કરે છે.
પાંચ-સ્તરીય મેમરી સોલ્યુશન
AgenticSTS પાંચ વ્યવસ્થિત, અલગ મેમરી સ્લોટ્સમાંથી દરેક નિર્ણય પ્રોમ્પ્ટને ફરીથી બનાવીને કોન્ટેક્સ્ટ ઇન્ફ્લેશન (context inflation) ની સમસ્યાને ઉકેલે છે. આ સુનિશ્ચિત કરે છે કે રમત ગમે તેટલી લાંબી ચાલે, પ્રોમ્પ્ટ પાતળો (lean) રહે—જે સરેરાશ આશરે 5,000 ટોકન્સ હોય છે. સ્તરો નીચે મુજબ છે:
- L1 (Fixed Protocol): એજન્ટ માટે મુખ્ય સૂચનાઓ.
- L2 (State Schemas): હાલમાં માન્ય એક્શનની વ્યાખ્યાઓ.
- L3 (Retrievable Rules): જરૂરિયાત મુજબ મેળવવામાં આવતા ચોક્કસ ગેમ નિયમો.
- L4 (Episodic Memory): લાંબા ગાળાનો કોન્ટેક્સ્ટ પૂરો પાડવા માટે અગાઉના રન (runs) ના સારાંશ.
- L5 (Skill Library): ચોક્કસ પરિસ્થિતિજન્ય પેટર્ન દ્વારા ટ્રિગર થતા વ્યૂહાત્મક નિયમો.
આ મોડ્યુલારિટી સંશોધકોને ચોક્કસપણે જાણી શકાય છે કે કયો ઘટક પ્રદર્શનમાં સુધારો લાવે છે. ઉદાહરણ તરીકે, માત્ર L5 સ્કીલ લાયબ્રેરીને સક્ષમ કરવાથી A0 મુશ્કેલી સ્તર પર એજન્ટનો વિન રેટ (win rate) 10 માંથી 3 થી વધીને 10 માંથી 6 થઈ ગયો હતો.
લર્નિંગ દ્વારા મુશ્કેલીનું સ્તર વધારવું
સ્ટ્રક્ચર્ડ અભિગમની સાચી શક્તિ ઇન્ટર-રન લર્નિંગ (inter-run learning) માં રહેલી છે. જ્યારે સ્ટાન્ડર્ડ એજન્ટો સૌથી નીચા મુશ્કેલી સ્તર
