একটি নতুন “প্রোঅ্যাক্টিভ মেমরি” (proactive memory) মডিউল লার্জ-ল্যাঙ্গুয়েজ-মডেল এজেন্টদের কাজের প্রয়োজনীয়তা, পরিবেশের তথ্য এবং অতীতের ব্যর্থতা ট্র্যাক করতে সাহায্য করে—মূল মডেলটিকে ফাইন-টিউন না করেই। বেঞ্চমার্ক টেস্টে এই সংযোজন Terminal-Bench 2.0-এ Sonnet 4.5-এর স্কোর ৮.৩ শতাংশ পয়েন্ট এবং τ2-Bench স্যুটে ৬.৮ পয়েন্ট বৃদ্ধি করেছে; একটি SETA-প্রশিক্ষিত মেমরি এজেন্ট অজানা সমস্যাগুলোতে একটি ফ্রোজেন (frozen) মডেলের pass@1 স্কোর ৩৭.৬% থেকে বাড়িয়ে ৪১.১% করেছে।

এজেন্টরা কেন লক্ষ্যভ্রষ্ট হয়

যখন একটি LLM-চালিত এজেন্ট একটি বহু-ধাপ বিশিষ্ট প্রক্রিয়া অনুসরণ করে, তখন এর অভ্যন্তরীণ “স্টেট” (state) বা অবস্থা ক্ষয়প্রাপ্ত হয়। গবেষকরা একে “বিহেভিয়ারাল স্টেট ডিসে” (behavioral state decay) বলেন: মডেলটি আগের নির্দেশাবলী, মূল তথ্য বা ইতিমধ্যে করা ভুলগুলো ভুলে যায়। এর ফলে ভুল সিদ্ধান্তের একটি ধারাবাহিকতা তৈরি হয় যা কাজ শেষ হওয়ার অনেক আগেই তা বাতিল করে দেয়।

এর সাধারণ সমাধান হলো কনটেক্সট উইন্ডো (context window)—অর্থাৎ মডেলটি একবারে যে পরিমাণ টেক্সট গ্রহণ করতে পারে—তা বড় করা। এটি কেবল ততক্ষণই সাহায্য করে যতক্ষণ না কাজটি উইন্ডোর সীমার বাইরে চলে যায়; এরপর পুরনো তথ্য বাদ পড়ে যায় এবং পুনরায় অবস্থার ক্ষয় শুরু হয়।

প্রয়োজন হলেই কেবল কাজ করে এমন একটি রিমাইন্ডার

নতুন এই পদ্ধতিতে একটি হালকা ওজনের সহায়ক মেমরি এজেন্ট যুক্ত করা হয়েছে যা মূল মডেলের রিজনিং ট্রেস (reasoning trace) পর্যবেক্ষণ করে এবং লক্ষ্যভিত্তিক রিমাইন্ডার প্রদান করে। অতীতের খণ্ডাংশের একটি স্থির তালিকা না টেনে, এই মেমরি মডিউলটি সিদ্ধান্ত নেয় কখন এবং কী প্রকাশ করতে হবে, এবং কেবল তখনই কাজ করে যখন মূল মডেলটি লক্ষ্যভ্রষ্ট হতে শুরু করে।

যেহেতু মেমরি লার্নারটি আলাদাভাবে প্রশিক্ষিত হয়, তাই প্রাথমিক অ্যাকশন মডেলটি ফ্রোজেন (frozen) থাকে। গবেষণাটি দেখায় যে, এই পৃথকীকরণটি লং-হরাইজন বেঞ্চমার্কে উল্লেখযোগ্য উন্নতি ঘটায়, যা প্রমাণ করে যে প্রোঅ্যাক্টিভ রিমাইন্ডার একটি সীমিত কনটেক্সট উইন্ডোর ঘাটতি পূরণ করতে পারে।

পরিসংখ্যান কী বলছে

  • Terminal-Bench 2.0: Sonnet 4.5 তার বেসলাইনের চেয়ে ৮.৩ পয়েন্ট বৃদ্ধি পেয়েছে।
  • τ2-Bench suite: একই মডেল ৬.৮ পয়েন্ট উন্নত হয়েছে।
  • Held-out টেস্টে Pass@1: একটি SETA-প্রশিক্ষিত মেমরি এজেন্ট একটি ফ্রোজেন মডেলের স্কোর ৩৭.৬% থেকে বাড়িয়ে ৪১.১% করেছে।

মূল মডেলের কোনো অতিরিক্ত ফাইন-টিউনিং ছাড়াই এই উন্নতিগুলো অর্জিত হয়েছে, তাই মেমরি কম্পোনেন্টটি বিদ্যমান সিস্টেমগুলোতে প্রয়োজন অনুযায়ী যোগ বা বিয়োগ করা যেতে পারে।

বর্তমান কাজের সীমাবদ্ধতা

পরীক্ষাগুলো নিচের বিষয়গুলো যাচাই করা থেকে বিরত রয়েছে:

  • স্কেল (Scale): মাল্টি-বিলিয়ন-প্যারামিটার মডেল বা লক্ষ লক্ষ ধাপ বিশিষ্ট কাজের ক্ষেত্রে মেমরি মডিউলটি একইভাবে কাজ করবে কি না, তার কোনো প্রমাণ এখনও পাওয়া যায়নি।
  • প্রোডাকশন খরচ (Production cost): রিমাইন্ডার সংরক্ষণ এবং পুনরুদ্ধার করার জন্য অতিরিক্ত overhead প্রয়োজন হয়, তবে এই গবেষণায় বাস্তব জগতের সিস্টেমে প্রয়োজনীয় অতিরিক্ত মেমরি বা কম্পিউটেশনের পরিমাণ নির্ধারণ করা হয়নি।

পরবর্তীতে কী লক্ষ্য রাখা উচিত

ভবিষ্যতের বেঞ্চমার্ক স্যুটে শুধুমাত্র কনটেক্সট সাইজ নয়, আরও অনেক কিছু পরিমাপ করার প্রয়োজন হবে। যে পরীক্ষাগুলো স্পষ্টভাবে স্টেট ডিসে (state decay) ট্র্যাক করে এবং সক্রিয় রিমাইন্ডার সিস্টেমকে পুরস্কৃত করে, সেগুলো এজেন্টের দীর্ঘমেয়াদী নির্ভরযোগ্যতা সম্পর্কে আরও স্পষ্ট ধারণা দেবে। গবেষকদের আরও দেখাতে হবে যে প্রোঅ্যাক্টিভ মেমরি মডেলের আকার এবং অপারেশনাল খরচ—উভয় ক্ষেত্রেই দক্ষতার সাথে স্কেল করতে পারে।

মূল কথা: একটি ছোট, আলাদাভাবে প্রশিক্ষিত মেমরি মডিউল লার্জ-ল্যাঙ্গুয়েজ-মডেল এজেন্টগুলোর জন্য একটি 'ওয়াচডগ' (watchdog) হিসেবে কাজ করতে পারে, যা কোনো কাজ বিচ্যুত হওয়ার আগেই তা শনাক্ত করে এবং সংশোধন করতে পারে।