ABSeeker-এর নতুন “Answer-Backtracked Credit Assignment” (ABC) পদ্ধতি দীর্ঘমেয়াদী অনুসন্ধান এজেন্টদের (long-horizon search agents) শুধুমাত্র চূড়ান্ত উত্তরের পরিবর্তে প্রতিটি স্বতন্ত্র পদক্ষেপের জন্য ক্রেডিট অর্জনের সুযোগ করে দেয়, এবং এটি দিয়ে প্রশিক্ষিত একটি ৪ বিলিয়ন-প্যারামিটার মডেল ইতিমধ্যেই অনেক বড় প্রতিযোগীদের সমকক্ষ বা এমনকি তাদের ছাড়িয়ে যেতে পারে।
এই যুগান্তকারী উদ্ভাবনটি গুরুত্বপূর্ণ কারণ বর্তমানের বেশিরভাগ এজেন্টকে শুধুমাত্র একটি কাজের শেষে বিচার করা হয়। যদি চূড়ান্ত উত্তর সঠিক হয়, তবে পুরো প্রক্রিয়াটিকে ভালো হিসেবে গণ্য করা হয়; আর যদি ভুল হয়, তবে পুরো সিকোয়েন্সটিকেই খারাপ হিসেবে চিহ্নিত করা হয়। এই 'সব বা কিছুই না' (all-or-nothing) ধরনের ফিডব্যাক প্রকৃত লার্নিং সিগন্যালকে আড়াল করে ফেলে—যেমন এমন কিছু ভালো পদক্ষেপ যা ভুলবশত একটি ভুলের পরে ঘটেছে, অথবা এমন কিছু অকেজো ক্লিক যা ভাগ্যক্রমে সঠিক ফলাফলের দিকে নিয়ে গেছে। ABSeeker-এর পদ্ধতি এই নিয়মের পরিবর্তন ঘটিয়েছে।
কেন পুরনো পদ্ধতিটি অপর্যাপ্ত
যখন একটি এজেন্ট অনুসন্ধান করে, কোড লেখে বা তথ্য সংগ্রহ করে, তখন এটি সাধারণত অনেকগুলো পদক্ষেপ নেয়: কুয়েরি পাঠানো, পেজ খোলা, কমান্ড চালানো, সিস্টেমের অবস্থা পরীক্ষা করা ইত্যাদি। পনেরোটি পদক্ষেপের একটি প্রক্রিয়ায়, একটি মাত্র ভুল পদক্ষেপ চূড়ান্ত উত্তরটিকে নষ্ট করে দিতে পারে, যদিও তার আগের পদক্ষেপগুলো সঠিক ছিল। বিপরীতে, একটি সঠিক উত্তর দিয়ে শেষ হওয়া প্রক্রিয়াটি কেবল ভাগ্যের ওপর নির্ভর করতে পারে, যেখানে বেশিরভাগ পদক্ষেপের কোনো বিশেষ মূল্য ছিল না। শুধুমাত্র চূড়ান্ত ফলাফলের ওপর ভিত্তি করে প্রশিক্ষণ দিলে মডেলটি পুরো প্রক্রিয়াটিকে একটি একক 'ব্ল্যাক বক্স' হিসেবে বিবেচনা করতে বাধ্য হয়, যার ফলে কোন উপ-আচরণগুলো (sub-behaviors) আসলে কার্যকর তা শেখা কঠিন হয়ে পড়ে।
এই পরিস্থিতি সফটওয়্যার ইঞ্জিনিয়ারিংয়ের ডিবাগিংয়ের মতোই। ডেভেলপাররা প্রতিটি লাইন অনুসরণ করেন, ত্রুটিপূর্ণ কলটি আলাদা করেন এবং তা ঠিক করেন। তবে, এজেন্টদের তাদের অভ্যন্তরীণ কাজের জন্য সমতুল্য কোনো "রসিদ" (receipt) দেওয়া হয়নি। এই অডিট ট্রেইল (audit trail) ছাড়া, ডেভেলপাররা বুঝতে পারেন না যে কোনো উন্নতি উন্নত যুক্তির কারণে হয়েছে নাকি কেবল ভাগ্যের কারণে, এবং তারা পদ্ধতিগতভাবে খারাপ অভ্যাসগুলো সংশোধন করতে পারেন না।
কীভাবে ABC ক্রেডিট অ্যাসাইনমেন্টকে নতুনভাবে সাজায়
Answer-Backtracked Credit Assignment সঠিক চূড়ান্ত উত্তর থেকে উল্টোভাবে কাজ করে। এটি প্রথমে সেই প্রয়োজনীয় সূত্রগুলো বের করে যার ওপর উত্তরটি নির্ভর করে—যেমন নির্দিষ্ট তথ্য, মধ্যবর্তী ফলাফল বা স্টেট চেক। তারপর এটি রেকর্ড করা ট্রেসের (trace) মাধ্যমে পিছনের দিকে ফিরে যায় এবং সেই সূত্রগুলোর বিপরীতে প্রতিটি পদক্ষেপের স্কোর নির্ধারণ করে। একটি পদক্ষেপ যা প্রয়োজনীয় সূত্রে সরাসরি অবদান রেখেছে তা পজিটিভ ক্রেডিট পায়; আর একটি অপ্রাসঙ্গিক বা ক্ষতিকারক পদক্ষেপ নেগেটিভ বা শূন্য স্কোর পায়।
এই স্কোরিংয়ের ওপর ভিত্তি করে দুটি প্রশিক্ষণ পদ্ধতি তৈরি করা হয়েছে:
- ABC-SFT (Supervised Fine-Tuning) লস ফাংশনকে (loss function) এমনভাবে পুনরায় ওজন (re-weight) দেয় যাতে উচ্চতর ক্রেডিট সম্পন্ন পদক্ষেপগুলো মডেলের ওপর বেশি প্রভাব ফেলে। মডেলটি এমন পদক্ষেপগুলোকে অগ্রাধিকার দিতে শেখে যা ঐতিহাসিকভাবে দরকারী সূত্র পেতে সাহায্য করেছে।
- ABC-GRPO (Gradient-based Reward Policy Optimization) প্রতিটি পদক্ষেপের স্কোরকে রিইনফোর্সমেন্ট লার্নিংয়ের জন্য একটি রিওয়ার্ড সিগন্যাল হিসেবে বিবেচনা করে, যা অনুসন্ধানের সেই নির্দিষ্ট অংশগুলোকে শক্তিশালী করে যা উত্তরটি পেতে সাহায্য করেছিল।
একটি বাইনারি পাস/ফেল লেবেলকে অবদানের একটি বিস্তারিত ম্যাপে রূপান্তর করার মাধ্যমে, ABC মডেলটিকে অনেক সমৃদ্ধ লার্নিং সিগন্যাল প্রদান করে।
প্রাথমিক ফলাফলগুলো জোরালো বার্তা দিচ্ছে
গবেষকরা একটি সাধারণ ৪ বিলিয়ন-প্যারামিটার মডেলের ওপর ABC প্রয়োগ করেছেন, যা একটি কনটেক্সট-ম্যানেজমেন্ট লেয়ার (context-management layer) দ্বারা সজ্জিত যা অনুসন্ধানের পরিবর্তনশীল অবস্থা ট্র্যাক করে। বেঞ্চমার্ক টাস্কগুলোতে, যেখানে ঐতিহ্যগতভাবে অনেক বড় এজেন্টরা এগিয়ে থাকে, সেখানে ABC-প্রশিক্ষিত মডেলটি সেই বড় সিস্টেমগুলোর সমকক্ষ হয়েছে অথবা তাদের চেয়ে ভালো পারফর্ম করেছে। মডেলের আকার না বাড়িয়েই এই পারফরম্যান্স বৃদ্ধি সম্ভব হয়েছে, যা নির্দেশ করে যে উন্নত ক্রেডিট অ্যাসাইনমেন্ট মডেলের প্যারামিটার সংখ্যা বৃদ্ধির বিকল্প হিসেবে কাজ করতে পারে।
মূল শিক্ষাটি সহজ: মডেলটিকে কী কাজ করেছে তার একটি স্পষ্ট রসিদ দিন, তাহলে এটি একই পরিমাণ ট্রেনিং ডেটা থেকে আরও বেশি ভ্যালু বা মান বের করে নিতে পারবে।
বাস্তব জগতের এজেন্টদের জন্য এর অর্থ কী
যে কোনো এজেন্ট যা বহু-ধাপের কাজ করে—যেমন কোডিং অ্যাসিস্ট্যান্ট, লিটারেচার-রিভিউ বট, কাস্টমার-সাপোর্ট টুল—তা তার কাজের একটি ট্রেসের (trace) ওপর নির্ভর করে। ABC দেখায় যে সেই ট্রেস সংরক্ষণ করা এবং মূল্যায়ন করা কেবল একটি অতিরিক্ত সুবিধা নয়; এটি কার্যকর শিক্ষার জন্য অপরিহার্য।
- কোডিং এজেন্টদের (Coding agents) পরিকল্পনা, প্রতিটি কমান্ড এবং কোড যাচাই করার টেস্ট রেজাল্ট লগ করার প্রয়োজন।
- রিসার্চ এজেন্টদের (Research agents) তাদের পাঠানো কুয়েরি, খোলা সোর্স এবং সংগ্রহ করা তথ্যগুলো সংরক্ষণ করতে হবে।
- সাপোর্ট এজেন্টদের (Support agents) প্রতিটি স্টেট চেক এবং সিদ্ধান্ত গ্রহণের ধাপগুলো রেকর্ড করা উচিত যা একটি সমাধানের দিকে নিয়ে গেছে।
যখন এই ট্রেসগুলো উপলব্ধ থাকে, তখন ABC নিখুঁতভাবে ক্রেডিট বরাদ্দ করতে পারে, যা মডেলটিকে ভালো অভ্যাসগুলো শক্তিশালী করতে এবং সেই ভাগ্যনির্ভর শর্টকাটগুলোকে বাদ দিতে সাহায্য করে যা অন্যথায় দক্ষতা হিসেবে ভুল ধারণা দিতে পারত।
পাল্টা যুক্তি এবং ব্যবহারিক বাধাগুলো
ABC-এর সুবিধাগুলোর সাথে অতিরিক্ত জটিলতাও আসে।
সারকথা
Answer-Backtracked Credit Assignment এজেন্টদের সার্চ করা, কোড করা এবং যুক্তি প্রদানের শিক্ষা দেওয়ার প্রচলিত পদ্ধতিকে আমূল বদলে দেয়। শুধুমাত্র চূড়ান্ত ফলাফলের পরিবর্তে যাত্রাপথের সঠিক পদক্ষেপগুলোকে পুরস্কৃত করার মাধ্যমে, এটি একটি মাঝারি আকারের মডেলকেও অনেক বড় মডেলের মতোই কার্যকরভাবে শিখতে সক্ষম করে তোলে। যারা বহু-ধাপ বিশিষ্ট কাজ সম্পন্ন করতে পারে এমন এজেন্ট তৈরি করছেন, তাদের জন্য একটি ট্রেস-কেন্দ্রিক (trace-centric) প্রশিক্ষণ পদ্ধতি গ্রহণ করা কেবল একটি বিকল্প নয়—বরং এটি নির্ভরযোগ্য, অডিটেবল এবং পরিশেষে আরও বুদ্ধিমান এআই তৈরির পথ।
