Kupanga kumbukumbu kwa aina hupunguza tokeni zinazotolewa kwa takriban 40%.

Kwa nini mfumo wa kumbukumbu wa kawaida (flat memory store) unashindwa kufanya kazi

Mafunzo mengi ya kuanzia kwa wanaoanza yanayofundisha wakala wa LLM "kukumbuka" kwa kuongeza kila kipande kipya cha habari kwenye orodha moja na kuirudisha orodha hiyo kwa modeli kila wakati. Msimbo (code) huo ni mfupi wa mistari mitatu tu, na unatoa mfano unaofanya kazi. Lakini kwa vitendo, orodha hiyo hukua bila udhibiti. Dalili mbili hutokea:

  • Wakala huchukulia data iliyopitwa na wakati kama bado ni ya kweli, kwa mfano kutoa ETA iliyopita saa nyingi zilizopita.
  • Dirisha la muktadha (context window) hujaa habari zisizo na msingi ambazo hazina ushawishi wowote kwenye jibu, jambo linaloongeza gharama za API na kupunguza kasi ya majibu.

Vector store ya kawaida au cache rahisi ya key-value haiwezi kutofautisha cheo cha kazi cha mtumiaji na hali ya muda ya mradi. Wakala anapofanya utafutaji wa kimaana (semantic search), algoriti ya ufanani inaweza kuonyesha ETA ya zamani kwa sababu tu swali lina maneno yaleyale, ingawa taarifa hiyo si muhimu tena.

Kumbukumbu iliyopangwa: makundi manne, lengo moja

Suluhisho ni kuacha kutendea kumbukumbu kama kitu kimoja kikubwa na kuanza kuainisha kila ingizo katika moja ya makundi manne:

  • User facts – sifa thabiti kama vile nafasi ya mtumiaji, lugha anayopendelea, au kiwango cha usalama. Hizi mara chache hubadilika na zinaweza kuhifadhiwa (cached) kwa kipindi chote cha mazungumzo.
  • Feedback – sheria zilizo wazi ambazo wakala lazima azitii, k.m., “usifichue kamwe nywila za hifadhidata” au “epuka ucheshi katika maswali ya uzingatiaji.” Kwa sababu zinaongoza tabia, zinapaswa kuwa kwenye system prompt badala ya kwenye kundi linaloweza kutafutika.
  • Project state – data zinazobadilika haraka kama vile ETA za sasa, maendeleo ya kazi, au tokeni za muda. Kundi hili linahitaji ukaguzi wa muda wa mwisho; mara tu muda unapoanguka nje ya dirisha lililowekwa, ingizo hilo linapaswa kufutwa.
  • References – viashiria vya huduma za nje, ID za hati, au API endpoints. Hizi si maudhui ya kuonyeshwa bali ni njia za kupata data mpya inapohitajika.

Mem0 inawawezesha watengenezaji kuambatisha metadata yoyote kwenye kila rekodi ya kumbukumbu. Kwa kuainisha kwenye uwanja wa “kind”, swali linaweza kwanza kuchuja kundi husika kabla ya LLM kuamua jinsi ya kutumia matokeo hayo.

Upatikanaji wa hatua mbili kwa kutumia Mem0

  1. Vuta kumbukumbu kwa aina – Swali fupi la kuchuja huomba Mem0 “feedback zote” au “ingizo za project-state zilizo mpya zaidi ya muda mfupi.” Seti ya matokeo tayari imepunguzwa ili iendane na kundi husika.
  2. Acha LLM iamue – Vipande vilivyochujwa huwekwa kwenye prompt pamoja na swali la sasa la mtumiaji. Modeli sasa inaweza kufanya mantiki kuhusu vipande hivyo bila kupitia habari zisizo na msingi.

Mfano halisi: badala ya kusubiri utafutaji wa kimaana upate sheria ya “usifanyie dhihaka hifadhidata,” mtengenezaji anaingiza sheria hiyo moja kwa moja kwenye system prompt wakati wa kuanza kwa kipindi na kuihifadhi kwa ajili ya mazungumzo yote. Hata kama swali la mtumiaji halina rejea ya wazi kuhusu hifadhidata, modeli tayari inajua kizuizi hicho.

Mbinu za kivitendo zinazopunguza gharama

  • Cache feedback rules – Hifadhi seti ya sheria mara moja kwa kila kipindi na itumie tena badala ya kutafuta tena kila wakati. Hii inapunguza matumizi ya tokeni kila mzunguko.
  • Ruka utafutaji wa project-state wakati hauhitajiki – Ikiwa mtumiaji anauliza swali la kifikra tu (“Kuna tofauti gani kati ya supervised na reinforcement learning?”), hakuna haja ya kuvuta data yoyote ya ETA au maendeleo ya kazi.

Kwa kutumia tabia hizi mbili, matumizi ya tokeni yanaweza kupunguzwa kwa takriban 40% ikilinganishwa na njia rahisi ya kumbukumbu ya kawaida (flat memory). Akiba hiyo inatafsiriwa moja kwa moja kuwa bili ndogo za API na huduma ya haraka, hasa kwa wakala wanaodumu kwa mazungumzo mengi.

Nani anafaidika, nani anahofia

Washindi – Timu zinazotengeneza bot za huduma kwa wateja, wasaidizi wa mifumo ya kazi ya ndani, au interface yoyote ya LLM ya mazungumzo mengi. Wanapata majibu ya kuaminika zaidi, kuepuka makosa ya aibu yanayosababishwa na data iliyopitwa na wakati, na kutumia bajeti zao kwa ufanisi zaidi.

Hitimisho

Ikiwa unataka wakala wa LLM ambaye anabaki kuwa makini katika vipindi virefu, acha kusukuma kila ukweli kwenye dirisha moja la muktadha. Weka lebo kwenye kila kumbukumbu kama user fact, feedback, project state, au reference, simamia muda wa mwisho pale inapohitajika, na uache chombo kama Mem0 kifanye kazi nzito. Matokeo yake ni majibu mapya zaidi, tokeni chache zisizo na mpangilio, na kupungua kwa wazi kwa gharama za uendeshaji.