ایک حالیہ بینچ مارک سے پتہ چلتا ہے کہ دو تہوں والا میموری ڈیزائن—RAM پر مبنی اسکریچ پیڈ (scratchpad) اور ایک مقامی SQLite-vec والٹ (vault)—میڈین (median) کوئری ٹائم 100 ms سے کم فراہم کرتا ہے، جبکہ ایک مقبول کلاؤڈ ویکٹر اسٹور سے منسلک ماہانہ 135 ڈالر کے بل کو ختم کر دیتا ہے۔ خود مختار AI ایجنٹس بنانے والے ڈویلپرز مکمل طور پر آن پریمیس (on-premise) سیٹ اپ چلا سکتے ہیں، جو اس بینچ مارک میں زیادہ تیز تھا اور اس میں کوئی ماہانہ لاگت نہیں آئی۔

موجودہ میموری طریقے کیوں ناکام رہتے ہیں

AI ایجنٹس کو اکثر ایک محدود رسپانس ونڈو کے اندر ہزاروں ماضی کے تعاملات (interactions)، حقائق یا ٹول کال کے نتائج کو یاد کرنے کی ضرورت ہوتی ہے۔ زیادہ تر ٹیمیں ہر ایمبیڈنگ (embedding) کو ایک مینیجڈ ویکٹر ڈیٹا بیس میں ڈال دیتی ہیں اور ہر تلاش کے لیے ریموٹ ویکٹر سرچ پر انحصار کرتی ہیں۔ یہ ماڈل اسکیل (scale) تو ہو سکتا ہے، لیکن یہ ہر کوئری کو نیٹ ورک کے ذریعے بھیجنے پر مجبور کرتا ہے، جس سے راؤنڈ ٹرپ ٹائم اور ماہانہ اخراجات بڑھ جاتے ہیں۔ بینچ مارک میں، کلاؤڈ سروس کا میڈین لیٹنسی (latency) 127 ms رہا اور ماہانہ بل 135 ڈالر سے تجاوز کر گیا؛ ٹیسٹ کے دوران سروس میں تعطل (outage) بھی ریکارڈ کیا گیا۔

میموری کو دو تہوں میں تقسیم کرنا

یہ دوہری تہوں والا آرکیٹیکچر "ورکنگ میموری" کو "لانگ ٹرم اسٹوریج" سے الگ کرتا ہے:

L1 Scratchpad (RAM)

  • مکمل طور پر پروسیس میموری میں رہتا ہے۔
  • موجودہ ٹاسک کا سیاق و سباق (context) اور حالیہ ترین ٹول کالز کو محفوظ رکھتا ہے۔
  • خام اسٹرنگز (raw strings) کو اسٹور کرتا ہے؛ کوئی ایمبیڈنگز جنریٹ نہیں کی جاتیں۔
  • 3 ms سے کم وقت میں نتائج فراہم کرتا ہے، جو کہ CPU کیش (cache) کے برابر ہے۔

L2 Vault (SQLite-vec)

  • تمام دیگر ایمبیڈنگز کو ایک مقامی SQLite ڈیٹا بیس میں محفوظ کرتا ہے جسے ویکٹر سرچ کی صلاحیتوں کے ساتھ بڑھایا گیا ہے۔
  • بینچ مارک میں استعمال ہونے والی 14,726 یادداشتوں کے مکمل سیٹ کو سنبھالتا ہے۔
  • تقریباً 94 ms میں میچز فراہم کرتا ہے، جو کہ بہت سے ریئل ٹائم ایجنٹس کے لیے 100 ms کے ہدف سے کافی نیچے ہے۔
  • ہوسٹ مشین کی اسٹوریج کے علاوہ اس کی کوئی اضافی قیمت نہیں ہے۔

SQLite-vec ایک اوپن سورس ایکسٹینشن ہے جو ایک معیاری ریلیشنل فائل میں approximate nearest-neighbor سرچ کا اضافہ کرتی ہے۔ چونکہ ڈیٹا بیس ایجنٹ والی ہی مشین پر ہوتا ہے، اس لیے نیٹ ورک ہاپ (network hop) کی ضرورت نہیں ہوتی، اور انجن تلاش کو تیز رکھنے کے لیے موجودہ SQLite انڈیکسنگ کے طریقوں کو دوبارہ استعمال کرتا ہے۔

اہم اعداد و شمار

سسٹم میڈین لیٹنسی ماہانہ لاگت رپورٹ شدہ قابل اعتمادیت
Cloud vector store (Pinecone) 127 ms ~$135 تعطل (Outages) دیکھا گیا
Local SQLite-vec vault 94 ms $0 100% اپ ٹائم

لاگت کا فرق ماہانہ تقریباً 135 ڈالر کے مقابلے میں 0 ڈالر ہے۔

والٹ کو منظم رکھنا

تمام ایمبیڈنگز کا خام ڈیٹا (raw dump) مطابقت (relevance) کو کم کر سکتا ہے۔ بینچ مارک کے مصنف نے ایک 'ڈی کی سسٹم' (decay system) متعارف کرایا ہے جو یادداشتوں کو ان کی تازگی (recency) اور تعدد (frequency) کے لحاظ سے اسکور کرتا ہے:

  • نئی یا بار بار استعمال ہونے والی چیزوں کو زیادہ وزن (weight) دیا جاتا ہے۔
  • وہ چیزیں جنہیں کافی عرصے سے استعمال نہیں کیا گیا، آہستہ آہستہ اپنا وزن کھو دیتی ہیں۔
  • ویٹڈ ڈی کی (weighted decay) "ریٹریول نوائز" (retrieval noise)—یعنی غیر متعلقہ میچز—کو 34% تک کم کر دیتا ہے۔

کم اسکور والی انٹریز کو حذف کر کے یا انڈیکس میں ان کی اہمیت کم کر کے، ایجنٹ پرانے ڈیٹا سے بچتا ہے اور ساتھ ہی والٹ کو مستقل کارکردگی کے لیے کافی ہلکا (lean) رکھتا ہے۔

خلاصہ

ان AI ایجنٹس کے لیے جنہیں ایک محدود وقت کے اندر ہزاروں یادداشتوں کو سنبھالنا ہوتا ہے، RAM پر مبنی اسکریچ پیڈ اور مقامی SQLite-vec والٹ کا امتزاج مکمل طور پر کلاؤڈ پر مبنی ویکٹر اسٹورز کا ایک عملی متبادل پیش کرتا ہے۔ یہ طریقہ کار رسپانس ٹائم کو کم کرتا ہے، بار بار آنے والی کلاؤڈ فیس کو ختم کرتا ہے اور بلا تعطل سروس فراہم کرتا ہے، جبکہ غیر متعلقہ ڈیٹا کو حذف کرنے کی صلاحیت کو بھی برقرار رکھتا ہے۔ لہٰذا، دو تہوں والے اس ماڈل کو اپنانے سے ایجنٹس زیادہ تیز، سستے اور زیادہ قابل اعتماد ہو سکتے ہیں۔