দুই বছরেরও কম সময়ে SWE-bench স্কোর ১.৯৬% থেকে বেড়ে ৭২.৭% হয়েছে, যে বৃদ্ধিকে সংবাদ শিরোনামে AI কোডিং ক্ষমতার ৩৭ গুণ লাফ হিসেবে তুলে ধরা হয়েছে। শিরোনামটি দৃষ্টি আকর্ষণ করলেও, এই সংখ্যাগুলো দুটি ভিন্ন পরীক্ষার তুলনা করছে, সফটওয়্যার ইঞ্জিনিয়ারিং দক্ষতার একটি একক, অবিচ্ছিন্ন উন্নতি নয়।

আসল সংখ্যাগুলো

২০২৩ সালে মূল SWE-bench ২,২৯৪টি আসল GitHub ইস্যুর ওপর AI এজেন্টদের মূল্যায়ন করেছিল। কাজগুলো ছিল অগোছালো: অস্পষ্ট বর্ণনা, ত্রুটিপূর্ণ টেস্ট এবং এমন অনেক সমস্যা যা একজন মানুষের পক্ষেও সমাধান করা কঠিন হতো। ২০২৫ সালের মধ্যে একই বেঞ্চমার্কের নাম ৭২.৭% স্কোর নিয়ে দেখা দেয়, কিন্তু পরীক্ষাটিকে মাত্র ৫০০টি কাজের একটি “Verified” (যাচাইকৃত) উপসেটে সংকুচিত করা হয়েছিল যা মানুষ স্পষ্টতা এবং সমাধানযোগ্যতার জন্য যাচাই করেছিল।

পরীক্ষাটি কীভাবে পরিবর্তিত হয়েছে

সম্পূর্ণ তালিকা থেকে Verified সেটে এই পরিবর্তনটি হলো প্রথম এবং সবচেয়ে দৃশ্যমান পরিবর্তন। মূল সংগ্রহটি ওপেন-সোর্স অবদানের বিশৃঙ্খল বাস্তবতাকে প্রতিফলিত করার চেষ্টা করেছিল—এমন সব ইস্যু যা অসম্পূর্ণ, poorly documented, অথবা অতিরিক্ত প্রেক্ষাপট ছাড়া সমাধান করা অসম্ভব। এর বিপরীতে, Verified সংস্করণটি সচেতনভাবে সেই বিশৃঙ্খলাকে ছেঁটে ফেলে। এটি একটি পরিচ্ছন্ন এবং আরও সহজতর সমস্যা সেট উপস্থাপন করে যেখানে উচ্চ স্কোর অর্জন করা বাস্তবসম্মতভাবে সম্ভব।

যেহেতু দুটি সংস্করণ সমস্যার ক্ষেত্রের ভিন্ন ভিন্ন অংশ পরিমাপ করে, তাই সরাসরি শতাংশের তুলনা বিভ্রান্তিকর। ১.৯৬% সংখ্যাটি কাঁচা বা ফিল্টার না করা কাজের পারফরম্যান্স নির্দেশ করে; আর ৭২.৭% সংখ্যাটি একটি কিউরেটেড (সংগৃহীত) নমুনার পারফরম্যান্স নির্দেশ করে যেখানে সাফল্যের সম্ভাবনা অনেক বেশি।

লক্ষ্যভিত্তিক ইঞ্জিনিয়ারিং

দ্বিতীয় এবং আরও সূক্ষ্ম একটি পরিবর্তন ঘটেছিল ডেভেলপাররা কীভাবে বেঞ্চমার্কটির দিকে অগ্রসর হচ্ছিলেন তার ক্ষেত্রে। ২০২৩ সালে, কেউ বিশেষভাবে SWE-bench জয় করার জন্য এজেন্ট তৈরি করেনি; পরীক্ষাটি বিশ্বের কোডিং চ্যালেঞ্জগুলোর একটি র‍্যান্ডম নমুনা হিসেবে কাজ করেছিল। ২০২৫ সালের মধ্যে, দলগুলো বেঞ্চমার্কটিকে একটি স্কোরবোর্ডে পরিণত করেছে। তারা Verified সেটে ভালো স্কোর করার সুনির্দিষ্ট লক্ষ্য নিয়ে স্কাফোল্ডিং (scaffolding), প্রম্পটিং কৌশল এবং ফাইন-টিউনড মডেল তৈরি করেছে।

যখন ইঞ্জিনিয়াররা একটি নির্দিষ্ট পরীক্ষা পাস করার জন্য একটি সিস্টেম ডিজাইন করেন, তখন সেই স্কোরটি সিস্টেমটি কতটা দক্ষ তা নয়, বরং সিস্টেমটি সেই পরীক্ষার সাথে কতটা সামঞ্জস্যপূর্ণ তা নির্দেশ করে। বেঞ্চমার্কটি একটি লক্ষ্যবস্তুতে পরিণত হওয়ার সাথে সাথেই এটি বাস্তব জগতের কাজের একটি প্রতিনিধিত্বমূলক নমুনা হওয়া বন্ধ করে দিয়েছে।

এই লাফ বা বৃদ্ধির প্রকৃত অর্থ কী

শিরোনাম আকর্ষক এই উন্নতিটি বাস্তব, এই অর্থে যে বর্তমান কোডিং এজেন্টগুলো মূল সেটের তুলনায় Verified কাজগুলোতে নাটকীয়ভাবে ভালো পারফর্ম করে। সেই উন্নতি প্রতিযোগিতা, গবেষণা পত্র এবং প্রোডাক্ট ডেমোর জন্য গুরুত্বপূর্ণ যা একই কিউরেটেড বেঞ্চমার্কের ওপর নির্ভর করে।

তবে, এই লাফটি এটি প্রমাণ করে না যে AI এজেন্টরা এখন দৈনন্দিন সফটওয়্যার ডেভেলপমেন্টের জটিলতা সামলাতে পারে। মূল ২,২৯৪টি ইস্যুর সেটটি এখনও বিদ্যমান এবং সেই সংস্করণের স্কোর এখনও কম।

যে প্রশ্নগুলো করা উচিত

যখনই আপনি বেঞ্চমার্কের ফলাফলে বিশাল পরিবর্তন দেখবেন, এই তিনটি বিষয় মাথায় রাখুন:

  • কোন সংস্করণটি রিপোর্ট করা হচ্ছে? Original, Lite, নাকি Verified? একই নাম ভিন্ন ভিন্ন কাজের ভাণ্ডারকে আড়াল করতে পারে।
  • কী ফিল্টার বা ছেঁটে ফেলা হয়েছে? কোলাহলপূর্ণ বা অসম্ভব কাজগুলো সরিয়ে ফেললে যেকোনো সিস্টেমের সাফল্যের সীমা বেড়ে যায়; তবে এটি সেই চ্যালেঞ্জগুলোকেও সরিয়ে দেয় যা প্রোডাকশনে অত্যন্ত গুরুত্বপূর্ণ।
  • সিস্টেমটি কি এই নির্দিষ্ট পরীক্ষাটি পাস করার জন্যই তৈরি করা হয়েছিল? যদি ডেভেলপাররা বেঞ্চমার্কের জন্য মডেল বা পাইপলাইন টিউন করে থাকেন, তবে সেই স্কোরটি অপ্টিমাইজেশন পরিমাপ করে, কাঁচা সক্ষমতা নয়।

ভবিষ্যতের দিকে দৃষ্টি

যতক্ষণ না এই ধরনের সুরক্ষা ব্যবস্থা মানদণ্ড হিসেবে প্রতিষ্ঠিত হচ্ছে, ততক্ষণ একজন AI কোডারের উপযোগিতার সেরা মাপকাঠি হবে ডেভেলপাররা প্রতিদিন যে বিশৃঙ্খল বাস্তব জগতের সমস্যার সম্মুখীন হন, তার ওপর তার পারফরম্যান্স।

সারকথা: একটি মেরামত করা বা লক্ষ্যভিত্তিক বেঞ্চমার্কে উচ্চতর স্কোর স্বয়ংক্রিয়ভাবে প্রমাণ করে না যে AI এজেন্টরা বাস্তব জগতের কোডের জটিলতার জন্য প্রস্তুত; আসল পরীক্ষাটি এখনও সেই ফিল্টারহীন সমস্যাগুলোর মধ্যেই রয়েছে যা ইঞ্জিনিয়াররা প্রতিদিন মোকাবিলা করেন।