ఇటీవలి బెంచ్‌మార్క్ ప్రకారం, రెండు పొరల మెమరీ డిజైన్—RAM-ఆధారిత scratchpad మరియు లోకల్ SQLite-vec vault—100 ms కంటే తక్కువ సగటు క్వెరీ సమయాన్ని అందిస్తుంది, అదే సమయంలో ఒక ప్రముఖ క్లౌడ్ వెక్టర్ స్టోర్‌కు అయ్యే నెలకు $135 బిల్లును తగ్గిస్తుంది. స్వయంప్రతిపత్తి కలిగిన AI agentsలను రూపొందించే డెవలపర్లు పూర్తిగా ఆన్-ప్రెమిస్ (on-premise) సెటప్‌ను ఉపయోగించవచ్చు; బెంచ్‌మార్క్ ప్రకారం, ఇది వేగంగా ఉండటమే కాకుండా ఎటువంటి నెలవారీ ఖర్చును కూడా కలిగించదు.

ప్రస్తుత మెమరీ విధానాలు ఎందుకు సరిపోవడం లేదు

AI agents తరచుగా తక్కువ సమయం లోపు వేలాది గత ఇంటరాక్షన్‌లు, వాస్తవాలు లేదా tool-call ఫలితాలను గుర్తుకు తెచ్చుకోవాల్సి ఉంటుంది. చాలా బృందాలు ప్రతి embeddingను ఒక మేనేజ్డ్ వెక్టర్ డేటాబేస్‌లోకి పంపిస్తాయి మరియు ప్రతి లుకప్ కోసం రిమోట్ వెక్టర్ సెర్చ్‌పై ఆధారపడతాయి. ఆ మోడల్ స్కేల్ అవుతుంది, కానీ అది ప్రతి క్వెరీని నెట్‌వర్క్ ద్వారా పంపాల్సి రావడం వల్ల round-trip time మరియు నెలవారీ ఖర్చు పెరుగుతాయి. బెంచ్‌మార్క్‌లో, క్లౌడ్ సర్వీస్ యొక్క సగటు లాటెన్సీ (median latency) 127 ms వద్ద ఉండగా, నెలవారీ బిల్లు $135 దాటింది; పరీక్షా సమయంలో సర్వీస్ అంతరాయం (outage) కూడా నమోదైంది.

మెమరీని రెండు స్థాయిలుగా విభజించడం

ఈ డ్యూయల్-టైర్ ఆర్కిటెక్చర్ "working memory"ని "long-term storage" నుండి వేరు చేస్తుంది:

L1 Scratchpad (RAM)

  • పూర్తిగా ప్రాసెస్ మెమరీలో ఉంటుంది.
  • ప్రస్తుత టాస్క్ కాంటెక్స్ట్ మరియు అత్యంత ఇటీవలి tool callsను కలిగి ఉంటుంది.
  • raw stringsలను నిల్వ చేస్తుంది; ఎటువంటి embeddings రూపొందించబడవు.
  • CPU cacheతో సమానంగా, 3 ms కంటే తక్కువ సమయంలో ఫలితాలను అందిస్తుంది.

L2 Vault (SQLite-vec)

  • వెక్టర్ సెర్చ్ సామర్థ్యాలతో విస్తరించబడిన లోకల్ SQLite డేటాబేస్‌లో మిగిలిన అన్ని embeddingsను నిల్వ చేస్తుంది.
  • బెంచ్‌మార్క్‌లో ఉపయోగించిన మొత్తం 14,726 మెమరీలను నిర్వహిస్తుంది.
  • అనేక రియల్-టైమ్ ఏజెంట్‌లకు 100 ms లక్ష్యం కంటే తక్కువగా, సుమారు 94 msలో ఫలితాలను అందిస్తుంది.
  • హోస్ట్ మెషీన్ స్టోరేజ్ మినహా ఇతర ఖర్చులు ఏవీ ఉండవు.

SQLite-vec అనేది ఒక ఓపెన్-సోర్స్ ఎక్స్‌టెన్షన్, ఇది స్టాండర్డ్ రిలేషనల్ ఫైల్‌కు approximate nearest-neighbor సెర్చ్‌ను జోడిస్తుంది. డేటాబేస్ ఏజెంట్ ఉన్న అదే మెషీన్‌లో ఉండటం వల్ల, నెట్‌వర్క్ హ్యాప్ (network hop) అవసరం ఉండదు మరియు లుకప్‌లను వేగంగా ఉంచడానికి ఇంజిన్ ఇప్పటికే ఉన్న SQLite ఇండెక్సింగ్ ట్రిక్స్‌ను తిరిగి ఉపయోగిస్తుంది.

ముఖ్యమైన గణాంకాలు

సిస్టమ్ సగటు లాటెన్సీ నెలవారీ ఖర్చు నివేదించబడిన విశ్వసనీయత
Cloud vector store (Pinecone) 127 ms ~$135 అంతరాయాలు నమోదయ్యాయి
Local SQLite-vec vault 94 ms $0 100 % అప్‌టైమ్

ఖర్చులో తేడా నెలకు సుమారు $135 కి బదులుగా $0 మాత్రమే.

వాల్ట్‌ను క్రమబద్ధంగా ఉంచడం

అన్ని embeddingsను నేరుగా నిల్వ చేయడం వల్ల వాటి ప్రాముఖ్యత (relevance) తగ్గే అవకాశం ఉంది. బెంచ్‌మార్క్ రచయిత మెమరీలను వాటి తాజాదనం (recency) మరియు ఫ్రీక్వెన్సీ (frequency) ఆధారంగా స్కోర్ చేసే 'డికే సిస్టమ్' (decay system)ను పరిచయం చేశారు:

  • కొత్త లేదా తరచుగా ఉపయోగించే అంశాలకు ఎక్కువ వెయిటేజీ లభిస్తుంది.
  • కొంతకాలంగా ఉపయోగించని అంశాలు క్రమంగా వెయిటేజీని కోల్పోతాయి.
  • ఈ వెయిటెడ్ డికే విధానం "retrieval noise"—అనగా సంబంధం లేని ఫలితాలను—34% తగ్గిస్తుంది.

తక్కువ స్కోరు ఉన్న ఎంట్రీలను తొలగించడం (pruning) లేదా ఇండెక్స్‌లో వాటి ప్రాధాన్యతను తగ్గించడం ద్వారా, ఏజెంట్ పాత డేటాను నివారించడమే కాకుండా, స్థిరమైన పనితీరు కోసం వాల్ట్‌ను తక్కువ పరిమాణంలో (lean) ఉంచుతుంది.

ముగింపు

తక్కువ సమయంలో వేలాది మెమరీలను నిర్వహించాల్సిన AI agents కోసం, RAM-ఆధారిత scratchpad మరియు లోకల్ SQLite-vec vault కలయిక, పూర్తిగా క్లౌడ్ ఆధారిత వెక్టర్ స్టోర్‌లకు ఒక ఆచరణాత్మక ప్రత్యామ్నాయాన్ని అందిస్తుంది. ఈ విధానం రెస్పాన్స్ సమయాన్ని తగ్గిస్తుంది, పునరావృతమయ్యే క్లౌడ్ ఫీజులను తొలగిస్తుంది మరియు అంతరాయం లేని సేవలను అందిస్తుంది, అదే సమయంలో సంబంధం లేని డేటాను తొలగించే సామర్థ్యాన్ని కూడా కాపాడుతుంది. అందువల్ల, ఈ రెండు స్థాయిల (two-tier) మోడల్‌ను అవలంబించడం వల్ల ఏజెంట్‌లు మరింత వేగంగా, తక్కువ ఖర్చుతో మరియు మరింత నమ్మదగినవిగా మారుతాయి.