एक हालिया बेंचमार्क से पता चलता है कि दो-स्तरीय मेमोरी डिज़ाइन—RAM-आधारित स्क्रैचपैड और एक स्थानीय SQLite-vec वॉल्ट—100 ms से कम का मीडियन क्वेरी समय प्रदान करता है, साथ ही एक लोकप्रिय क्लाउड वेक्टर स्टोर से जुड़े $135 प्रति माह के बिल को भी खत्म कर देता है। स्वायत्त (autonomous) AI एजेंट बनाने वाले डेवलपर्स पूरी तरह से ऑन-प्रिमाइसेस (on-premise) सेटअप चला सकते हैं, जो इस बेंचमार्क में तेज़ था और जिसमें कोई मासिक लागत नहीं आई।

मौजूदा मेमोरी दृष्टिकोण क्यों कम पड़ जाते हैं

AI एजेंटों को अक्सर एक सीमित रिस्पॉन्स विंडो के भीतर हज़ारों पिछले इंटरैक्शन, तथ्यों या टूल-कॉल परिणामों को याद करने की आवश्यकता होती है। अधिकांश टीमें हर एम्बेडिंग (embedding) को एक प्रबंधित (managed) वेक्टर डेटाबेस में डाल देती हैं और हर लुकअप के लिए रिमोट वेक्टर सर्च पर निर्भर रहती हैं। वह मॉडल स्केल तो करता है, लेकिन यह हर क्वेरी को नेटवर्क के माध्यम से भेजने के लिए मजबूर करता है, जिससे राउंड-ट्रिप समय और मासिक खर्च बढ़ जाता है। बेंचमार्क में, क्लाउड सर्विस की मीडियन लेटेंसी 127 ms थी और महीने का बिल $135 से अधिक था; परीक्षण अवधि के दौरान आउटेज (outage) भी दर्ज किया गया था।

मेमोरी को दो स्तरों में विभाजित करना

यह दो-स्तरीय आर्किटेक्चर "वर्किंग मेमोरी" को "लॉन्ग-टर्म स्टोरेज" से अलग करता है:

L1 Scratchpad (RAM)

  • पूरी तरह से प्रोसेस मेमोरी में रहता है।
  • वर्तमान टास्क कॉन्टेक्स्ट और सबसे हालिया टूल कॉल्स को रखता है।
  • रॉ स्ट्रिंग्स (raw strings) स्टोर करता है; कोई एम्बेडिंग जेनरेट नहीं की जाती है।
  • 3 ms से कम में परिणाम देता है, जो CPU कैश के समान है।

L2 Vault (SQLite-vec)

  • वेक्टर सर्च क्षमताओं के साथ विस्तारित एक स्थानीय SQLite डेटाबेस में अन्य सभी एम्बेडिंग्स को सुरक्षित रखता है।
  • बेंचमार्क में उपयोग की गई 14,726 यादों के पूरे सेट को संभालता है।
  • लगभग 94 ms में मैच लौटाता है, जो कई रियल-टाइम एजेंटों के लिए 100 ms के लक्ष्य से काफी नीचे है।
  • होस्ट मशीन के स्टोरेज के अलावा इसकी कोई लागत नहीं है।

SQLite-vec एक ओपन-सोर्स एक्सटेंशन है जो एक मानक रिलेशनल फ़ाइल में एप्रोक्सिमेट नियरस्ट-नेबर (approximate nearest-neighbor) सर्च जोड़ता है। क्योंकि डेटाबेस एजेंट वाली ही मशीन पर रहता है, इसलिए कोई नेटवर्क हॉप (network hop) नहीं होता है, और इंजन लुकअप को तेज़ रखने के लिए मौजूदा SQLite इंडेक्सिंग ट्रिक्स का पुन: उपयोग करता है।

महत्वपूर्ण आंकड़े

सिस्टम मीडियन लेटेंसी मासिक लागत रिपोर्ट की गई विश्वसनीयता
क्लाउड वेक्टर स्टोर (Pinecone) 127 ms ~$135 आउटेज देखे गए
स्थानीय SQLite-vec वॉल्ट 94 ms $0 100% अपटाइम

लागत का अंतर $0 बनाम लगभग $135 प्रति माह है।

वॉल्ट को व्यवस्थित रखना

सभी एम्बेडिंग्स का रॉ डंप (raw dump) प्रासंगिकता को कम कर सकता है। बेंचमार्क के लेखक ने एक डिके सिस्टम (decay system) पेश किया है जो हालियापन (recency) और आवृत्ति (frequency) के आधार पर यादों को स्कोर देता है:

  • नए या बार-बार एक्सेस किए जाने वाले आइटमों को अधिक वेटेज (weight) मिलता है।
  • जो आइटम कुछ समय से उपयोग नहीं किए गए हैं, उनका वेटेज धीरे-धीरे कम हो जाता है।
  • वेटेड डिके "रिट्रीवल नॉइज़" (retrieval noise)—अप्रासंगिक मैच—को 34% तक कम कर देता है।

कम स्कोर वाली प्रविष्टियों को हटाने (pruning) या इंडेक्स में उन्हें नीचे करने से, एजेंट पुराने डेटा से बचता है और साथ ही निरंतर प्रदर्शन के लिए वॉल्ट को पर्याप्त रूप से हल्का (lean) बनाए रखता है।

निष्कर्ष

उन AI एजेंटों के लिए जिन्हें कम समय सीमा के भीतर हज़ारों यादों को संभालना होता है, एक RAM-फर्स्ट स्क्रैचपैड और स्थानीय SQLite-vec वॉल्ट का संयोजन पूरी तरह से क्लाउड-आधारित वेक्टर स्टोर का एक व्यावहारिक विकल्प प्रदान करता है। यह दृष्टिकोण रिस्पॉन्स समय को कम करता है, आवर्ती क्लाउड शुल्क को समाप्त करता है और निर्बाध सेवा प्रदान करता है, और साथ ही अप्रासंगिक डेटा को हटाने की क्षमता को भी बनाए रखता है। इसलिए, दो-स्तरीय मॉडल को अपनाने से एजेंट तेज़, सस्ते और अधिक भरोसेमंद बन सकते हैं।