Meta AI نے ایک دو ایجنٹ والا میموری سسٹم (dual-agent memory system) متعارف کرایا ہے جس نے کمانڈ لائن بینچ مارک پر خود مختار AI اسسٹنٹس کی کامیابی کی شرح کو 38% سے بڑھا کر 46% اور ملٹی ڈومین کنورسیٹل بینچ مارک پر 55% سے بڑھا کر 62% کر دیا ہے۔ یہ اضافہ ایک غیر تبدیل شدہ "ایکشن" ماڈل کو ایک مخصوص "میموری" کوچ کے ساتھ جوڑنے سے حاصل ہوا ہے جو ٹاسک کے حالیہ مراحل پر نظر رکھتا ہے اور صرف اس وقت مداخلت کرتا ہے جب سیاق و سباق (context) کے کھو جانے کا خطرہ ہو۔

طویل دورانیے کے AI ٹاسکس میں چھپا ہوا نقص

جب ایک لینگویج ماڈل کسی کثیر مرحلہ وار مسئلے کو حل کرتا ہے، تو ہر مرحلہ گفتگو کی تاریخ میں مزید متن شامل کرتا ہے۔ ماڈل کی اگلی حرکت پوری گفتگو (transcript) سے رہنمائی حاصل کرنی چاہیے، لیکن عملی طور پر متعلقہ حقائق دب جاتے ہیں۔ Meta کے محققین اسے "بیہیویئرل اسٹیٹ ڈیکے" (behavioral state decay) کہتے ہیں – یعنی جیسے جیسے کانٹیکسٹ ونڈو بڑھتی ہے، ایجنٹ کے مقصد کا احساس بتدریج ختم ہو جاتا ہے۔ صرف ونڈو کو چوڑا کرنے سے مسئلہ حل نہیں ہوتا؛ معلومات موجود تو ہو سکتی ہیں لیکن وہ ماڈل کی پیش گوئیوں پر اثر انداز نہیں ہوتیں۔

روایتی میموری ایڈ آنز دستاویزات تلاش کرتے ہیں یا جوابات کو ذاتی نوعیت کا بناتے ہیں۔ وہ کبھی یہ فیصلہ نہیں کرتے کہ کب ماضی کی معلومات کا کوئی حصہ موجودہ عمل کو متاثر کرنے کے لیے کافی اہم ہے۔ نتیجے کے طور پر، طویل دورانیے والے خود مختار ایجنٹس بھٹک جاتے ہیں، غلطیوں کو دہراتے ہیں، یا کسی اہم شرط کو نظر انداز کر دیتے ہیں جو بات چیت کے آغاز میں ذکر کی گئی تھی۔

عمل درآمد کو نگرانی سے الگ کرنا

Meta کا جواب ایک پلگ اینڈ پلے آرکیٹیکچر ہے جو ایکگزیکیوشن انجن کو نگرانی کرنے والے میموری لیئر سے الگ کرتا ہے۔

  • Action Agent – ایک غیر تبدیل شدہ لینگویج ماڈل جو کمانڈز جاری کرتا ہے، ٹولز استعمال کرتا ہے، اور ظاہری آؤٹ پٹ تیار کرتا ہے۔ تجربات میں یہ Claude Sonnet 4.5 ہے۔
  • Memory Agent – ایک دوسرا ماڈل جو وقتاً فوقتاً حالیہ مراحل کی سلائیڈنگ ونڈو کا جائزہ لیتا ہے۔ آزمائشوں میں یہ Claude Opus 4.6 ہے۔

میموری ایجنٹ ایک تین حصوں والا میموری بینک رکھتا ہے:

  1. Private Status Field – ترقی اور خطرے کے بارے میں اندرونی فلیگز جو ایکشن ایجنٹ نہیں دیکھ سکتا۔
  2. Knowledge Memory – مستحکم حقائق جیسے فائل پاتھ، کنفیگریشن ویلیوز، یا API اینڈ پوائنٹس۔
  3. Procedural Memory – کیا کام کر گیا اور کیا ناکام رہا اس کا لاگ، بشمول ناکام کمانڈز اور ان کے حل۔

پوری گفتگو کا خلاصہ کرنے کے بجائے، میموری ایجنٹ فیصلہ کرتا ہے کہ آیا مداخلت کرنی چاہیے یا نہیں۔ اگر اسے محسوس ہوتا ہے کہ کوئی اہم تفصیل بھول گئی ہے، تو وہ ایک مختصر یاد دہانی شامل کرتا ہے؛ اگر نہیں، تو وہ خاموش رہتا ہے، جس سے اضافی ٹوکنز اور لیٹنسی (latency) سے بچا جا سکتا ہے۔

بینچ مارکس تصور کی تصدیق کرتے ہیں

Meta نے دو عوامی سوٹس پر سسٹم کا تجربہ کیا:

بینچ مارک بنیادی کامیابی دو ایجنٹ والی کامیابی
Terminal-Bench 2.0 (کمانڈ لائن) 38% 46%
tau2-Bench (ریٹیل، ایئر لائن، ٹیلی کام) 55% 62%

یہ اضافہ قابل ذکر ہے کیونکہ دونوں لائنوں میں ایک ہی ایکشن ماڈل استعمال ہوا ہے؛ صرف میموری لیئر بدلی گئی ہے۔ Mem0 کے مقابلے میں، جو کی ورڈ سرچ پر انحصار کرنے والا ایک وسیع پیمانے پر استعمال ہونے والا پروڈکشن میموری لیئر ہے، Meta کے طریقہ کار نے بہتر کارکردگی دکھائی۔ ایک فرضی ایئر لائن بکنگ کے منظرنامے میں، صارف نے غلطی سے "Gold status" کا دعویٰ کیا۔ میموری ایجنٹ نے اس غلطی کو پکڑا، ایکشن ماڈل کو ایئر لائن کی API سے تصدیق شدہ لائلٹی اسٹیٹس چیک پر بھروسہ کرنے کی یاد دہانی کرائی، اور لین دین کامیابی سے مکمل ہو گیا۔

صنعت کو اس پر توجہ کیوں دینی چاہیے

نتیجہ ایک ایسے راستے کی نشاندہی کرتا ہے جو مزید بڑے ماڈلز پر انحصار نہیں کرتا۔ کانٹیکسٹ مینجمنٹ کا بوجھ ایک ہلکے پھلکے نگران (lightweight overseer) پر ڈال کر، ڈویلپرز بنیادی ماڈل کے پیرامیٹر کاؤنٹ کو بڑھائے بغیر ان ٹاسکس کے لیے بھروسہ مندی کو بہتر بنا سکتے ہیں جو درجنوں مراحل پر محیط ہوتے ہیں—جیسے سافٹ ویئر ڈی بگنگ، پیچیدہ کسٹمر سروس فلو، یا خود مختار ڈیٹا پائپ لائنز۔

کمپنیوں کے لیے جو خود مختار ایجنٹس بنا رہی ہیں، یہ آرکیٹیکچر پیش کرتا ہے:

  • کم غلطیوں کا بھٹکنا (Reduced error drift) – سسٹم فعال طور پر بھولی ہوئی شرائط کے خلاف حفاظت کرتا ہے۔
  • ٹوکن کی کارکردگی (Token efficiency) – مداخلتیں منتخب ہوتی ہیں، اس لیے ایکشن ماڈل کم غیر متعلقہ ٹوکنز پر کارروائی کرتا ہے۔
  • ماڈیولر اپ گریڈز (Modular upgrades) – ایکشن کور کو دوبارہ تربیت دیے بغیر میموری کوچ کو نئے ماڈل سے بدلا جا سکتا ہے۔

توازن اور کھلے سوالات

آگے کیا دیکھنا ہے

اہم نکتہ: ایک مخصوص میموری کوچ "بیہیویئرل اسٹیٹ ڈیکے" کو روک سکتا ہے، جو بنیادی ریژوننگ ماڈل کو دوبارہ ڈیزائن کیے بغیر کامیابی کی شرح میں دو ہندسوں تک اضافہ کر سکتا ہے۔ اس کا نقصان سسٹم کی پیچیدگی میں اضافہ ہے، لیکن اس کا فائدہ—زیادہ قابل اعتماد خود مختار ایجنٹس—اضافی انجینئرنگ کوشش کے قابل ہو سکتا ہے۔