ഒരു പുതിയ ബെഞ്ച്മാർക്ക് പ്രകാരം, രണ്ട് പാളികളുള്ള (two-layer) മെമ്മറി ഡിസൈൻ—RAM അടിസ്ഥാനമാക്കിയുള്ള സ്ക്രാച്ച്പാഡും (scratchpad) ഒരു ലോക്കൽ SQLite-vec വോൾട്ടും (vault) ചേർന്നുള്ള സംവിധാനം—പ്രതിമാസം $135 വരുന്ന പ്രശസ്തമായ ക്ലൗഡ് വെക്റ്റർ സ്റ്റോറുകളുടെ ചിലവ് ഒഴിവാക്കുന്നതോടൊപ്പം, 100 ms-ൽ താഴെ മീഡിയൻ ക്വറി സമയവും (median query time) നൽകുന്നു. ഓട്ടോണമസ് AI ഏജന്റുകൾ നിർമ്മിക്കുന്ന ഡെവലപ്പർമാർക്ക് പൂർണ്ണമായും ഓൺ-പ്രെമിസ് (on-premise) സെറ്റപ്പ് ഉപയോഗിക്കാം; ബെഞ്ച്മാർക്ക് അനുസരിച്ച് ഇത് വേഗതയേറിയതും പ്രതിമാസ ചിലവില്ലാത്തതുമാണ്.
നിലവിലുള്ള മെമ്മറി സമീപനങ്ങൾ എവിടെയാണ് പരാജയപ്പെടുന്നത്
AI ഏജന്റുകൾക്ക് പലപ്പോഴും വളരെ കുറഞ്ഞ സമയത്തിനുള്ളിൽ ആയിരക്കണക്കിന് പഴയ സംഭാഷണങ്ങൾ, വസ്തുതകൾ അല്ലെങ്കിൽ ടൂൾ-കോൾ (tool-call) ഫലങ്ങൾ എന്നിവ ഓർത്തെടുക്കേണ്ടി വരാറുണ്ട്. മിക്ക ടീമുകളും എല്ലാ എംബെഡിംഗുകളും (embeddings) ഒരു മാനേജ്ഡ് വെക്റ്റർ ഡാറ്റാബേസിലേക്ക് മാറ്റുകയും ഓരോ ലുക്കപ്പിനും (lookup) റിമോട്ട് വെക്റ്റർ സെർച്ചുകളെ ആശ്രയിക്കുകയും ചെയ്യുന്നു. ഈ മോഡൽ സ്കെയിലിംഗ് സാധ്യമാണെങ്കിലും, ഓരോ ക്വറിയും നെറ്റ്വർക്ക് വഴി കടന്നുപോകേണ്ടി വരുന്നത് റൗണ്ട്-ട്രിപ്പ് സമയവും (round-trip time) പ്രതിമാസ ചിലവും വർദ്ധിപ്പിക്കുന്നു. ബെഞ്ച്മാർക്കിൽ, ക്ലൗഡ് സർവീസിന്റെ മീഡിയൻ ലേറ്റൻസി (median latency) 127 ms ആയിരുന്നു, കൂടാതെ മാസാവസാനം ബില്ല് $135 കടന്നു; പരിശോധനാ കാലയളവിൽ സർവീസ് തടസ്സപ്പെട്ടതായും (outage) രേഖപ്പെടുത്തിയിട്ടുണ്ട്.
മെമ്മറിയെ രണ്ട് തട്ടുകളായി തിരിക്കുക
ഈ ഡ്യുവൽ-ടയർ ആർക്കിടെക്ചർ "വർക്കിംഗ് മെമ്മറിയെ" (working memory) "ലോംഗ്-ടേം സ്റ്റോറേജിൽ" (long-term storage) നിന്ന് വേർതിരിക്കുന്നു:
L1 Scratchpad (RAM)
- പൂർണ്ണമായും പ്രോസസ് മെമ്മറിയിൽ (process memory) പ്രവർത്തിക്കുന്നു.
- നിലവിലെ ടാസ്ക് കോൺടെക്സ്റ്റും (task context) ഏറ്റവും പുതിയ ടൂൾ കോളുകളും ഇതിൽ സൂക്ഷിക്കുന്നു.
- റോ (raw) സ്ട്രിംഗുകൾ സൂക്ഷിക്കുന്നു; എംബെഡിംഗുകൾ ഒന്നും തന്നെ നിർമ്മിക്കപ്പെടുന്നില്ല.
- CPU കാഷെക്ക് (CPU cache) സമാനമായി 3 ms-ൽ താഴെ സമയത്തിനുള്ളിൽ ഫലങ്ങൾ നൽകുന്നു.
L2 Vault (SQLite-vec)
- വെക്റ്റർ സെർച്ച് ശേഷിയുള്ള ഒരു ലോക്കൽ SQLite ഡാറ്റാബേസിൽ മറ്റ് എല്ലാ എംബെഡിംഗുകളും സൂക്ഷിക്കുന്നു.
- ബെഞ്ച്മാർക്കിൽ ഉപയോഗിച്ച 14,726 മെമ്മറികളുടെ മുഴുവൻ ശേഖരവും ഇത് കൈകാര്യം ചെയ്യുന്നു.
- പല റിയൽ-ടൈം ഏജന്റുകൾക്കും ലക്ഷ്യമിടുന്ന 100 ms-ൽ താഴെയായി, ഏകദേശം 94 ms-ൽ ഫലങ്ങൾ നൽകുന്നു.
- ഹോസ്റ്റ് മെഷീന്റെ സ്റ്റോറേജ് അല്ലാതെ മറ്റ് ചിലവുകളില്ല.
ഒരു സ്റ്റാൻഡേർഡ് റിലേഷണൽ ഫയലിലേക്ക് അപ്രോക്സിമേറ്റ് നിയേർഡ്-നെയിബർ സെർച്ച് (approximate nearest-neighbor search) ചേർക്കുന്ന ഒരു ഓപ്പൺ സോഴ്സ് എക്സ്റ്റൻഷനാണ് SQLite-vec. ഡാറ്റാബേസ് ഏജന്റിന്റെ അതേ മെഷീനിൽ തന്നെ ഉള്ളതിനാൽ നെറ്റ്വർക്ക് ഉപയോഗിക്കേണ്ടതില്ല, കൂടാതെ ലുക്കപ്പുകൾ വേഗത്തിലാക്കാൻ നിലവിലുള്ള SQLite ഇൻഡക്സിംഗ് രീതികൾ തന്നെ ഈ എഞ്ചിൻ ഉപയോഗിക്കുന്നു.
പ്രധാനപ്പെട്ട കണക്കുകൾ
| System | Median latency | Monthly cost | Reported reliability |
|---|---|---|---|
| Cloud vector store (Pinecone) | 127 ms | ~$135 | Outages observed |
| Local SQLite-vec vault | 94 ms | $0 | 100 % uptime |
പ്രതിമാസം ഏകദേശം $135-ന് പകരം $0 ആണ് ചിലവ് വ്യത്യാസം.
വോൾട്ട് വൃത്തിയായി സൂക്ഷിക്കുക
എല്ലാ എംബെഡിംഗുകളും അലക്ഷ്യമായി സൂക്ഷിക്കുന്നത് പ്രസക്തി കുറയ്ക്കാൻ കാരണമാകും. മെമ്മറികളുടെ പുതുമയും (recency) ആവർത്തനവും (frequency) അടിസ്ഥാനമാക്കി അവയ്ക്ക് സ്കോർ നൽകുന്ന ഒരു 'ഡിക്കേ സിസ്റ്റം' (decay system) ബെഞ്ച്മാർക്ക് രചയിതാവ് അവതരിപ്പിച്ചു:
- പുതിയതോ അല്ലെങ്കിൽ ഇടയ്ക്കിടെ ഉപയോഗിക്കുന്നതോ ആയ ഐറ്റങ്ങൾക്ക് ഉയർന്ന വെയിറ്റ് (weight) ലഭിക്കുന്നു.
- കുറച്ചു കാലമായി ഉപയോഗിക്കാത്തവയുടെ വെയിറ്റ് ക്രമേണ കുറയുന്നു.
- ഈ വെയിറ്റഡ് ഡിക്കേ രീതി "റിട്രീവൽ നോയിസ്" (retrieval noise)—അതായത് പ്രസക്തമല്ലാത്ത ഫലങ്ങൾ—34% കുറയ്ക്കുന്നു.
കുറഞ്ഞ സ്കോറുള്ള എൻട്രികൾ ഒഴിവാക്കുകയോ ഇൻഡക്സിൽ അവയുടെ സ്ഥാനം കുറയ്ക്കുകയോ ചെയ്യുന്നതിലൂടെ, ഏജന്റിന് പഴയ ഡാറ്റ ഒഴിവാക്കാനും ഒപ്പം മികച്ച പ്രകടനം കാഴ്ചവെക്കാൻ വോൾട്ട് ലളിതമായി സൂക്ഷിക്കാനും സാധിക്കുന്നു.
ചുരുക്കം
പരിമിതമായ സമയത്തിനുള്ളിൽ ആയിരക്കണക്കിന് മെമ്മറികൾ കൈകാര്യം ചെയ്യേണ്ട AI ഏജന്റുകൾക്ക്, പൂർണ്ണമായും ക്ലൗഡ് അധിഷ്ഠിത വെക്റ്റർ സ്റ്റോറുകൾക്ക് പകരമായി RAM-ആധിഷ്ഠിത സ്ക്രാച്ച്പാഡും ലോക്കൽ SQLite-vec വോൾട്ടും ചേർന്നുള്ള സംവിധാനം പ്രായോഗികമായ ഒരു ബദലാണ്. ഈ രീതി റെസ്പോൺസ് സമയം കുറയ്ക്കുകയും, ആവർത്തിച്ചുള്ള ക്ലൗഡ് ഫീസുകൾ ഒഴിവാക്കുകയും, തടസ്സമില്ലാത്ത സേവനം നൽകുകയും ചെയ്യുന്നു; അതോടൊപ്പം തന്നെ പ്രസക്തമല്ലാത്ത ഡാറ്റ ഒഴിവാക്കാനുള്ള കഴിവും നിലനിർത്തുന്നു. അതിനാൽ, ഈ രണ്ട് തട്ടുകളുള്ള (two-tier) മോഡൽ സ്വീകരിക്കുന്നത് ഏജന്റുകളെ കൂടുതൽ വേഗതയുള്ളതും ചിലവ് കുറഞ്ഞതും വിശ്വസനീയവുമാക്കും.
