কেন AI সার্চ এজেন্টরা ব্যর্থ হয়: অস্পষ্টতার (Ambiguity) সংকটময় সমস্যা

ডেভেলপাররা যখন AI এজেন্টদের রিজনিং বা যুক্তিবোধের গভীরতা বাড়ানোর দিকে মনোযোগ দিচ্ছেন, তখন স্বায়ত্তশাসিত গবেষণার (autonomous research) আসল বাধা সার্চ করার ক্ষমতা নয়—বরং অস্পষ্টতা সামলানোর অক্ষমতা। একটি নতুন গবেষণা প্রকাশ করেছে যে, এমনকি সবচেয়ে উন্নত LLM-গুলোও থেমে স্পষ্টীকরণের জন্য প্রশ্ন করতে হিমশিম খায়, যা প্রায়শই দীর্ঘ রিজনিং চেইনে একটি বিপর্যয়কর "error cascade" বা ত্রুটির ক্রমবৃদ্ধি ঘটায়।

DiscoBench-এর যুগান্তকারী সাফল্য

Tencent Hunyuan এবং Tsinghua University-র গবেষকরা DiscoBench নামে একটি বিশেষায়িত টেস্ট ফ্রেমওয়ার্ক প্রবর্তন করেছেন, যা ডিজাইন করা হয়েছে ভাষা মডেলগুলো কীভাবে অস্পষ্ট, অসম্পূর্ণ বা ভুল ইউজার কুয়েরি সামলায় তা মূল্যায়ন করার জন্য। GAIA বা BrowseComp-এর মতো পূর্ববর্তী বেঞ্চমার্কগুলোর মতো নয়, যা নিখুঁতভাবে তৈরি প্রম্পট ধরে নেয়, DiscoBench বাস্তব জগতের বিশৃঙ্খলা বা জটিলতাকে সিমুলেট করে।

এই ফ্রেমওয়ার্কটি এগারোটি ডোমেইন জুড়ে ২১১টি টাস্ক নিয়ে গঠিত—যার মধ্যে বিজ্ঞান, রাজনীতি এবং সঙ্গীত অন্তর্ভুক্ত—এবং এতে ৪৬৩টি নির্দিষ্ট অস্পষ্টতা বা ambiguity পয়েন্ট রয়েছে। প্রতিটি চেকপয়েন্টে, একটি এজেন্টকে সিদ্ধান্ত নিতে হয় যে সে কি অনুসন্ধান চালিয়ে যাবে, উত্তর প্রদান করবে, নাকি সবচেয়ে গুরুত্বপূর্ণভাবে, ব্যবহারকারীর কাছে স্পষ্টীকরণ চাইবে। মানুষের সাথে মিথস্ক্রিয়া সিমুলেট করার জন্য, গবেষকরা Gemini 3 Flash-কে একটি LLM-ভিত্তিক ইউজার সিমুলেটর হিসেবে ব্যবহার করেছেন, যাতে এজেন্ট যখন একটি উচ্চমানের ফলো-আপ প্রশ্ন করে তখন সে ক্লু বা সূত্র প্রদান করতে পারে।

Error Cascade: কেন বেশি অনুসন্ধান করা মানেই ভালো নয়

গবেষণাটি একটি বিপজ্জনক প্যাটার্ন শনাক্ত করেছে: যখন একটি এজেন্ট কোনো অস্পষ্ট সত্তা (entity) বা পরস্পরবিরোধী মানদণ্ডের সম্মুখীন হয়, তখন এটি সাহায্য চাওয়ার পরিবর্তে প্রায়শই "আরও কঠোরভাবে অনুসন্ধান" করার সিদ্ধান্ত নেয়। এটি এমন একটি পরিস্থিতির সৃষ্টি করে যেখানে মডেলটি পরিষ্কার এবং ব্যাকরণগতভাবে সঠিক অনুসন্ধান চালায়, কিন্তু সেগুলো মূলত ভুল দিকে পরিচালিত হয়।

তথ্য দেখায় যে "বেশি অনুসন্ধান করা" আসলে নির্ভুলতা বা accuracy কমিয়ে দিতে পারে। "SearchHeavyGuess" প্রোফাইলে—যেখানে মডেলগুলো বারবার অনুসন্ধান করে কিন্তু স্পষ্টীকরণের পরিবর্তে শেষ পর্যন্ত অনুমান করে ফেলে—সেখানে সাফল্যের হার কমে ৫১.৯% এ নেমে আসে। বিপরীতে, যে মডেলগুলো "SearchThenAsk" কৌশল ব্যবহার করেছে তারা ৯৩.৪% অনেক উচ্চতর সাফল্যের হার অর্জন করেছে। এটি প্রমাণ করে যে ব্যর্থতা তথ্য সংগ্রহের অভাব নয়, বরং কথোপকথনমূলক এজেন্সির (conversational agency) ব্যর্থতা।

শীর্ষস্থানীয় মডেলগুলোর পারফরম্যান্স বেঞ্চমার্ক

এগারোটি শীর্ষস্থানীয় মডেল পরীক্ষা করে একটি রূঢ় বাস্তবতা প্রকাশ পেয়েছে: অস্পষ্টতার সম্মুখীন হলে এমনকি ইন্ডাস্ট্রির লিডাররাও ৫০% নির্ভুলতার বাধা অতিক্রম করতে হিমশিম খাচ্ছে।

  • Doubao Seed 2.0 Pro ৪৩.১% এন্ড-টু-এন্ড নির্ভুলতার সাথে তালিকার শীর্ষে ছিল।
  • Gemini 3.1 Pro Preview ৪০.৮% নিয়ে তার ঠিক পরেই ছিল।
  • Claude Opus 4.7 ৩৯.৮% অর্জন করেছে, যদিও এর চেকপয়েন্ট পাস রেট ছিল বেশি (৫৭%)।
  • Qwen3.6 Max এবং MiniMax M2.7 যথাক্রমে ১২.৩% এবং ১৬.১% নিয়ে অনেক পেছনে ছিল।

মজার ব্যাপার হলো, গবেষকরা যখন একটি "Guided" সিস্টেম প্রম্পট প্রদান করেছিলেন যা মডেলগুলোকে স্পষ্টভাবে অস্পষ্টতা সম্পর্কে সতর্ক করেছিল, তখনও এন্ড-টু-এন্ড নির্ভুলতা মাত্র ২৮.৬% থেকে বেড়ে ৩৩.৭% হয়েছে। এটি নির্দেশ করে যে অস্পষ্টতা "শনাক্ত করা" এবং "মিথস্ক্রিয়ার মাধ্যমে তা কীভাবে সমাধান করতে হয় তা জানা" — এই দুটি সম্পূর্ণ আলাদা জ্ঞানীয় দক্ষতা (cognitive skills)।

AI জগতের ওপর এর প্রভাব

এই গবেষণাটি এজেন্টিক AI (agentic AI) উন্নয়নের কেন্দ্রবিন্দু পরিবর্তন করে দিচ্ছে। সত্যিকারের নির্ভরযোগ্য স্বায়ত্তশাসিত গবেষক তৈরি করতে হলে, ইন্ডাস্ট্রিকে কেবল "tool call"-এর ফ্রিকোয়েন্সি বাড়ানোর বাইরে এসে interactive reasoning বা মিথস্ক্রিয়ামূলক যুক্তিবোধের দিকে মনোনিবেশ করতে হবে। LLM অপ্টিমাইজেশনের পরবর্তী ধাপ কেবল উন্নত তথ্য পুনরুদ্ধার নয়—বরং জটিল, বহু-ধাপের কাজের সময় ত্রুটিগুলো যাতে বৃদ্ধি না পায়, সেজন্য উন্নত "clarification logic" বা স্পষ্টীকরণ লজিক তৈরি করা।

মূল বিষয়সমূহ

  • অস্পষ্টতাই হলো ব্যর্থতার প্রধান কারণ: AI এজেন্টরা ব্যর্থ হয় কারণ তারা তথ্য খুঁজে পায় না তা নয়, বরং কুয়েরি অস্পষ্ট বা অপর্যাপ্ত হলে তারা স্পষ্টীকরণ চাইতে ব্যর্থ হয়।
  • "Search-Heavy" ফাঁদ: ভুল সত্তার জন্য বারবার অনুসন্ধান করা একটি "error cascade" তৈরি করে যা কেবল অনুমানের চেয়েও পুনরুদ্ধার করা অনেক বেশি কঠিন।
  • শনাক্তকরণ $\neq$ সমাধান: উচ্চ শনাক্তকরণ স্কোর (একটি ত্রুটি চিহ্নিত করা) স্বয়ংক্রিয়ভাবে উচ্চ সাফল্যের হারে রূপান্তরিত হয় না, যা মডেলগুলো কীভাবে কথোপকথনমূলক সমস্যা সমাধান করে তার মধ্যে একটি ঘাটতিকে তুলে ধরে।