SEED পেপারের লেখকরা এমন একটি পদ্ধতির উন্মোচন করেছেন যা রিইনফোর্সমেন্ট-লার্নিং (RL) এজেন্টদের তাদের নিজস্ব ব্যর্থতার লগগুলোকে (failure logs) নতুন ট্রেনিং ডেটাতে রূপান্তরিত করতে সাহায্য করে। এটি ALFWorld বেঞ্চমার্কে গড় স্কোর বাড়িয়ে ৯১.৮ করেছে এবং ট্রেনিং ডেটার পরিমাণ প্রায় ৪০% কমিয়ে এনেছে। একই কৌশল এজেন্টরা আগে কখনও দেখেনি এমন টাস্কগুলোতে ১৫.৩ পয়েন্টের লাফিয়ে বৃদ্ধি ঘটিয়েছে, যা প্রমাণ করে যে অতিরিক্ত মানুষের তত্ত্বাবধান ছাড়াই একটি মডেল তার ভুল থেকে শিখতে পারে।

কেন RL এজেন্টদের শুধুমাত্র পাস/ফেল ফ্ল্যাগের চেয়ে বেশি কিছু প্রয়োজন

সাধারণ RL সেটআপগুলোতে একটি দীর্ঘ এপিসোডের শেষে এজেন্টকে পুরস্কৃত করা হয়। এই সংকেত সিস্টেমকে জানায় যে ফলাফলটি ভুল ছিল, কিন্তু ভুলটি কোথায় হয়েছিল সে সম্পর্কে কিছুই বলে না। যদি দশ ধাপ আগে কোনো ভুল হয়ে থাকে—যেমন হয়তো ভুল সার্চ টার্ম ব্যবহার করা হয়েছে বা ভুল ফাইল খোলা হয়েছে—তবে চূড়ান্ত বাইনারি সংকেতটি সমস্ত মধ্যবর্তী তথ্য হারিয়ে ফেলে। এই তথ্যের ঘাটতি গবেষকদের ব্যর্থতার কারণ খুঁজে বের করার জন্য বিশাল পরিমাণ এপিসোড সংগ্রহ করতে বাধ্য করে।

SEED কীভাবে ফিডব্যাক লুপ পরিবর্তন করে

SEED (Self-Evolving On-Policy Distillation) প্রতিটি এপিসোডের পরে একটি দ্বিতীয় লার্নিং পাস যোগ করে:

  1. টাস্ক সম্পন্ন করা – এজেন্ট কাজ শেষ করে এবং সাধারণ সাফল্য/ব্যর্থতার লেবেল পায়।
  2. নিজস্ব ট্রান্সক্রিপ্ট পড়া – কাজের ক্রম, পর্যবেক্ষণ এবং মধ্যবর্তী সিদ্ধান্তগুলো মডেলের কাছে পুনরায় পাঠানো হয়।
  3. প্রাকৃতিক ভাষায় শিক্ষা লেখা – মডেল ছোট ছোট বাক্য তৈরি করে যা ব্যাখ্যা করে কী ভুল হয়েছে, যেমন, “সার্চ টার্ম ‘X’ অপ্রাসঙ্গিক ফলাফল দিয়েছে” বা “‘Z’-এর পরিবর্তে ‘Y’ ফাইলটি খোলা হয়েছে”।
  4. শিক্ষাগুলোকে পলিসি আপডেটে ডিস্টিল করা – এই বাক্যগুলো একটি নতুন অন-পলিসি ডিস্টিলেশন ধাপের লক্ষ্যবস্তু হয়ে ওঠে, যা মডেলকে সংশোধনের পেছনের যুক্তি শেখায়।

এই তৈরি করা শিক্ষাগুলো ইনফারেন্সের সময় ব্যবহৃত প্রম্পট নয়; এগুলো হলো অভ্যন্তরীণ ট্রেনিং সিগন্যাল যা পলিসিকে নতুন রূপ দেয়। কার্যত, এজেন্ট নিজেই নিজের শিক্ষক হয়ে ওঠে, যা কাঁচা ব্যর্থতার লগগুলোকে সুসংগঠিত জ্ঞানে রূপান্তরিত করে।

মেমরি ট্রিকস বা স্মৃতি কৌশলের চেয়ে এই পদ্ধতিটি কেন বেশি কার্যকর

একটি সাধারণ বিকল্প হলো একটি এক্সটার্নাল মেমরি বাফার যুক্ত করা যা পরবর্তীতে ব্যবহারের জন্য উল্লেখযোগ্য অবস্থা বা নোট সংরক্ষণ করে। এই কৌশলটি একটি বিশাল “ফাইলিং ক্যাবিনেট” তৈরি করে যেখানে এজেন্টকে সঠিক সময়ে সঠিক তথ্য খুঁজে বের করতে শিখতে হয়—এটি একটি জটিল সমস্যা যা অতিরিক্ত কাজের চাপ বাড়ায় এবং কাজ ও ফলাফলের মধ্যকার কার্যকারণ সম্পর্ক (causal link) মিস করতে পারে।

SEED এই রিট্রিভাল বা তথ্য খোঁজার সমস্যাটি এড়িয়ে যায়। ডিস্টিলেশনের মাধ্যমে সরাসরি পলিসির মধ্যে শিক্ষাটি অন্তর্ভুক্ত করার মাধ্যমে, এজেন্ট সংশোধনটিকে পরে দেখার জন্য কোনো নোট হিসেবে নয়, বরং একটি দক্ষতা হিসেবে আত্মস্থ করে। এর ফলে ত্রুটি শনাক্তকরণ এবং আচরণ পরিবর্তনের মধ্যে একটি নিবিড় সম্পর্ক তৈরি হয়।

গুরুত্বপূর্ণ পরিসংখ্যান

  • ALFWorld বেঞ্চমার্ক – গড় স্কোর ৯১.৮, যা একই এনভায়রনমেন্ট ব্যবহার করা প্রচলিত RL বেসলাইনগুলোকে ছাড়িয়ে গেছে।
  • ডেটা দক্ষতা (Data efficiency) – প্রায় ৪০% কম ট্রেনিং এপিসোড দিয়ে একই বা তার চেয়ে ভালো পারফরম্যান্স অর্জন করে।
  • জেনারালাইজেশন (Generalization) – অজানা টাস্কগুলোতে, এই পদ্ধতিটি স্ট্যান্ডার্ড RL-এর তুলনায় ১৫.৩ পয়েন্ট বেশি স্কোর দেয়, যা নির্দেশ করে যে স্ব-তৈরি করা শিক্ষাগুলো স্থানান্তরযোগ্য রিজনিং প্যাটার্ন ধরতে পারে।

এই পরিসংখ্যানগুলো নির্দেশ করে যে SEED জটিল এজেন্ট প্রশিক্ষণের জন্য কম্পিউটেশনাল এবং ডেটা বাজেট কমিয়ে দিতে পারে, যা সেই সব টিমের জন্য আশীর্বাদ যারা বিশাল সিমুলেশন রিসোর্স পায় না।

ঝুঁকি এবং সীমাবদ্ধতা

এই কৌশলটি মডেলের নিজস্ব অভিজ্ঞতা সঠিকভাবে ব্যাখ্যা করার ক্ষমতার ওপর নির্ভর করে। যদি এজেন্ট পরিবেশকে ভুলভাবে পড়ে—যেমন কোনো ব্যর্থতার জন্য ভুল কারণকে দায়ী করা—তবে এটি আত্মবিশ্বাসের সাথে ভুল শিক্ষা তৈরি করতে পারে। এই ধরনের হ্যালুসিনেশন বা কাল্পনিক উপদেশের ওপর প্রশিক্ষণ দিলে খারাপ অভ্যাস আরও দৃঢ় হতে পারে। লেখকরা উল্লেখ করেছেন যে এটি মানুষের পোস্ট-মর্টেমের মতোই, যেখানে বিশ্লেষকরা কখনও কখনও অতিরিক্ত গোছানো ব্যাখ্যা তৈরি করেন যা গভীর সমস্যাগুলোকে আড়াল করে দেয়।

পরবর্তীতে কী লক্ষ্য রাখা উচিত

  • বিদ্যমান RL পাইপলাইনের সাথে ইন্টিগ্রেশন – যেহেতু SEED শুধুমাত্র একটি পোস্ট-এপিসোড প্রসেসিং ধাপ যোগ করে, তাই সামান্য ইঞ্জিনিয়ারিং প্রচেষ্টায় এটি অনেক বিদ্যমান ট্রেনিং লুপে যুক্ত করা সম্ভব।

যারা RL এজেন্ট তৈরি করছেন তাদের এপিসোড লগগুলোকে শুধুমাত্র আর্কাইভাল ডেটা হিসেবে দেখা উচিত নয়। প্রতিটি রান শেষ হওয়ার পর, সিস্টেমকে নিচের বিষয়গুলো বের করতে বলুন:

  • সেই সিদ্ধান্ত যা টাস্কটিকে সবচেয়ে বেশি এগিয়ে নিয়ে গেছে।
  • সেই ধারণা (assumption) যা সবচেয়ে বেশি ধাপ অপচয় করেছে।
  • একটি সহজ পরীক্ষা যা ত্রুটিটি আরও আগে ধরতে পারত।

এই নোটগুলোকে অ্যাড-হক প্রম্পট হিসেবে ফেরত দেওয়ার পরিবর্তে, SEED-এর প্রস্তাবিত ডিস্টিলেশন ধাপে এগুলো ইনপুট হিসেবে দিন। এর ফলাফল স্পষ্ট: উন্নত পারফরম্যান্স, কম ডেটা এবং এমন একটি মডেল যা নিজের ভুলগুলো ব্যাখ্যা করতে শেখে।

সারকথা: ব্যর্থতার ট্রান্সক্রিপ্টগুলোকে স্বয়ং-সৃষ্ট শিক্ষায় রূপান্তর করা বিরল রিওয়ার্ড ফিডব্যাককে একটি সমৃদ্ধ ও পুনরায় ব্যবহারযোগ্য ট্রেনিং সিগন্যালে রূপান্তরিত করতে পারে, যা দ্রুততর এবং আরও ডেটা-দক্ষ RL-এর একটি ব্যবহারিক পথ প্রদান করে।