রিয়েল-টাইমে একসাথে কাজ করা পাঁচটি Gemini 3.5 Flash এজেন্ট ৩০টি প্রশ্নের একটি Project Euler সেট থেকে ৮৭% সমাধান করেছে, যা এককভাবে কাজ করা পাঁচটি এজেন্ট (৭২%) এবং উভয় মেজোরিটি-ভোট (majority-vote) বেসলাইনকেও (৮০% একক, ৯০% সহযোগিতামূলক) ছাড়িয়ে গেছে। সহযোগিতামূলক প্রচেষ্টায় গড় সময়ও চার মিনিট কমেছে, যা প্রতিটি সমস্যার জন্য ১৪ মিনিট থেকে কমে ১০ মিনিটে দাঁড়িয়েছে, এবং বেশিরভাগ সমাধান পাঁচ মিনিটের কম সময়ে পাওয়া গেছে।
কেন এই পরীক্ষাটি গুরুত্বপূর্ণ
AI কোডিং অ্যাসিস্ট্যান্টগুলো ইতিমধ্যেই কোড স্নিপেট তৈরি করা, কোড ডিবাগ করা এবং সম্পূর্ণ প্রোগ্রাম তৈরি করতে পারে। গবেষকরা সাধারণত একটি প্রম্পটের ওপর একটি একক মডেল পরীক্ষা করেন এবং তার উত্তরের মান নির্ধারণ করেন। এই পরীক্ষাটি একটি ভিন্ন প্রশ্ন উত্থাপন করে: কাজ করার সময় প্রাপ্ত ফলাফলগুলো শেয়ার করা এজেন্টদের একটি দল কি কেবল স্বতন্ত্র উত্তরগুলো গণনা করা "wisdom of the crowd" পদ্ধতির চেয়ে ভালো ফলাফল করতে পারে?
Project Euler সমস্যাগুলো অ্যালগরিদমিক চিন্তাভাবনার জন্য একটি আদর্শ মানদণ্ড (benchmark) হিসেবে কাজ করে। এগুলোতে গাণিতিক অন্তর্দৃষ্টি এবং দক্ষ কোডিংয়ের মিশ্রণ রয়েছে, যা বাস্তব জগতের প্রোগ্রামিং কাজের জন্য একটি ভালো বিকল্প হিসেবে কাজ করে যেখানে সঠিকতা এবং গতি অত্যন্ত গুরুত্বপূর্ণ।
পরীক্ষাটি কীভাবে সাজানো হয়েছিল
- এজেন্ট: Antigravity প্ল্যাটফর্মের মাধ্যমে অ্যাক্সেস করা Gemini 3.5 Flash-এর পাঁচটি ইনস্ট্যান্স।
- সিনারিও:
- প্রতিটি এজেন্ট প্রতিটি সমস্যা একা সমাধান করেছে এবং নিজস্ব উত্তর রিপোর্ট করেছে।
- একই পাঁচটি এজেন্ট রিয়েল-টাইমে সহযোগিতা করেছে, মধ্যবর্তী ফলাফলগুলো প্রচার করেছে এবং একে অপরের পদক্ষেপগুলো নিশ্চিত করেছে।
- উভয় সেটআপের জন্যই, একটি সাধারণ মেজোরিটি-ভোট অ্যাগ্রিগেটর পাঁচটি স্বতন্ত্র উত্তরকে একত্রিত করেছে।
- মেট্রিক্স: নির্ভুলতা (সঠিক উত্তরের শতাংশ) এবং রানটাইম (প্রতিটি সমস্যার গড় সময়, সেইসাথে সম্পন্ন হওয়ার সময়ের বিন্যাস)।
সংখ্যাগুলো কী প্রকাশ করে
- একক নির্ভুলতা: ৭২%
- সহযোগিতামূলক নির্ভুলতা: ৮৭%
- একক মেজোরিটি-ভোট নির্ভুলতা: ৮০%
- সহযোগিতামূলক মেজোরিটি-ভোট নির্ভুলতা: ৯০%
একক এজেন্টদের জন্য গড় রানটাইম ১৪ মিনিট থেকে কমে সহযোগিতামূলক দলের জন্য ১০ মিনিটে নেমে এসেছে। বেশিরভাগ সহযোগিতামূলক প্রচেষ্টা পাঁচ মিনিটের কম সময়ে শেষ হয়েছে, যেখানে একক প্রচেষ্টাগুলো প্রায়শই ৩০ মিনিটের টাইমআউট সীমায় পৌঁছে যেত।
ব্যবধান ব্যাখ্যা করার মূল পর্যবেক্ষণসমূহ
- একজনের জন্য অসম্ভব, অনেকের জন্য সম্ভব – একটি নির্দিষ্ট সমস্যার ক্ষেত্রে সমস্ত একক এজেন্ট ব্যর্থ হয়েছিল, তবুও সহযোগিতামূলক দলটি আংশিক ফলাফল আদান-প্রদান করেছে এবং সম্মিলিতভাবে সঠিক উত্তরে পৌঁছেছে।
- ক্রস-চেকিংয়ের মাধ্যমে ভুল ধরা – স্বতন্ত্র এজেন্টরা মাঝে মাঝে যুক্তির ফাঁদে পা দিত; রিয়েল-টাইমে তথ্য তুলনা করার মাধ্যমে দলটি এই ভুলগুলো ধরে ফেলেছিল।
- দ্রুত অভিসরণ (Rapid convergence) – যখন কোনো এজেন্ট একটি গুরুত্বপূর্ণ মধ্যবর্তী মান খুঁজে পেত, তখন সেটি ফলাফলটি প্রচার করত, যা অন্যদের অপ্রয়োজনীয় কাজ বাদ দিতে এবং দ্রুত চূড়ান্ত সমাধানে পৌঁছাতে সাহায্য করত।
লুকানো খরচ এবং সীমাবদ্ধতা
পরীক্ষায় মাত্র পাঁচটি এজেন্ট ব্যবহার করা হয়েছে; একই দক্ষতা ডজন বা শত শত এজেন্টের ক্ষেত্রেও কাজ করবে কি না তা এখনও অস্পষ্ট। তাছাড়া, মেজোরিটি-ভোট অ্যাগ্রিগেটরটি এখনও ভালো ফলাফল করেছে (সহযোগিতার সাথে ৯০%)।
পরবর্তীতে কী লক্ষ্য রাখা উচিত
- স্কেলিং পরীক্ষা – একশটি এজেন্ট কি নির্ভুলতা আরও বাড়াবে, নাকি সমন্বয়ের অতিরিক্ত বোঝা (coordination overhead) প্রাধান্য পাবে?
- ভূমিকা বিশেষায়ন – নির্দিষ্ট কাজ বরাদ্দ করা (যেমন, একজন এজেন্ট সংখ্যাতত্ত্বের ওপর মনোযোগ দেবে, অন্যজন অপ্টিমাইজেশনের ওপর) মুক্ত-রূপ সহযোগিতার চেয়ে সুবিধা আরও বাড়িয়ে দিতে পারে।
- বিস্তৃত মানদণ্ড – কোড-জেনারেটর চ্যালেঞ্জ, ডিবাগিং স্যুট বা বাস্তব জগতের সফটওয়্যার তৈরির ক্ষেত্রে একই ফ্রেমওয়ার্ক প্রয়োগ করলে দেখা যাবে যে এই সুবিধাগুলো গাণিতিক ধাঁধার বাইরেও কার্যকর কি না।
সারসংক্ষেপ
এআই কোডিং এজেন্টদের মধ্যে রিয়েল-টাইম সহযোগিতা অ্যালগরিদমিক কাজের ক্ষেত্রে সাফল্যের হার এবং গতি উভয়ই বাড়াতে পারে, যা একক প্রচেষ্টা এবং এমনকি সাধারণ ক্রাউড ভোটের চেয়েও উন্নত। এই পদ্ধতিটি আশাব্যঞ্জক, তবে এর স্কেলেবিলিটি এবং ব্যয়-কার্যকারিতা এখনও অমীমাংসিত প্রশ্ন যা ভবিষ্যতের গবেষণার মাধ্যমে উত্তর দিতে হবে।
উৎস: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0
