২০টি লার্জ-ল্যাঙ্গুয়েজ মডেলের (LLM) একটি নতুন বেঞ্চমার্ক দেখাচ্ছে যে ২০২৬ সালে কোনো একটি একক মডেল সব ধরণের কাজের ওপর আধিপত্য বিস্তার করতে পারছে না। প্রতিটি কাজকে একজন বিশেষজ্ঞের (specialist) কাছে পাঠিয়ে দিলে খরচ কমানো এবং কাজ দ্রুত সম্পন্ন করা সম্ভব। এই গবেষণায় Anthropic, OpenAI, Google, xAI, Meta এবং বেশ কিছু চীনা ল্যাবকে তুলনা করা হয়েছে এবং দেখা গেছে যে ভুল মডেল নির্বাচন করলে টাকা এবং সময় উভয়ই নষ্ট হয়।
কেন একটি একক LLM আর কার্যকর নয়
এক বছর আগে বেশিরভাগ ডেভেলপার কোডিং থেকে শুরু করে গবেষণার উত্তর—সবকিছুর জন্য একটি মাত্র মডেল বেছে নিতেন। কোডিং, টুল অর্কেস্ট্রেশন (tool orchestration), গভীর যুক্তি (deep reasoning) এবং সরাসরি সাশ্রয়ী কার্যকারিতার জন্য তৈরি মডেলগুলোর মধ্যে ব্যবধান এতটাই বেড়ে গেছে যে, এখন 'একই মডেল সব কাজের জন্য' (one-size-fits-all) পদ্ধতিটি উপকারের চেয়ে ক্ষতিই বেশি করছে।
বেঞ্চমার্কটি কীভাবে তৈরি করা হয়েছে
আমি ২০টি মডেলের সবকটিতে একই ধরণের টাস্ক সেট চালিয়েছি, ভেন্ডরদের মার্কেটিং দাবিগুলোকে উপেক্ষা করেছি এবং স্বাধীন ও পুনরুৎপাদনযোগ্য (reproducible) তথ্যের ওপর গুরুত্ব দিয়েছি। টাস্কগুলোকে চারটি ভাগে ভাগ করা হয়েছে:
- Coding and autonomy – প্রোডাকশন-গ্রেড কোড তৈরি করা, এজেন্টিক লুপ (agentic loops) পরিচালনা করা।
- Tool use and orchestration – এক্সটার্নাল API কল করা, ফাইল ম্যানিপুলেট করা, কম্পিউটার চালানো।
- Reasoning and science – গণিতের সমস্যা সমাধান করা, গবেষণার তথ্য বিশ্লেষণ করা।
- Value – সর্বনিম্ন খরচে গ্রহণযোগ্য মান প্রদান করা।
এর ফলে প্রাপ্ত ম্যাট্রিক্স ইঞ্জিনিয়ারদের কোনো জনপ্রিয় নামকে ডিফল্ট হিসেবে না বেছে নিয়ে, কাজের ধরন অনুযায়ী মডেলের শক্তির সাথে সামঞ্জস্য করতে সাহায্য করে।
কোন বিভাগগুলোতে কোন মডেলগুলো এগিয়ে আছে
Coding and autonomy – Claude Opus 5 এবং Fable 5 ধারাবাহিকভাবে তালিকার শীর্ষে ছিল, যা সবচেয়ে কম রিট্রাই (retry) করে জটিল কোড জেনারেশন এবং মাল্টি-স্টেপ লুপ পরিচালনা করতে সক্ষম। GPT-5.6 Sol এর ঠিক পরেই ছিল, যা শীর্ষ দুটি মডেল অনুপলব্ধ থাকলে একটি নির্ভরযোগ্য বিকল্প হিসেবে কাজ করে।
Tool use and orchestration – এক্সটার্নাল টুল ব্যবহারের ক্ষেত্রে Meta-র Muse Spark 1.1 সবচেয়ে নির্ভরযোগ্য প্রমাণিত হয়েছে, অন্যদিকে Gemini 3.6 Flash স্প্রেডশিট ম্যানিপুলেশন এবং UI অটোমেশনের মতো কম্পিউটার ব্যবহারের ক্ষেত্রে পারদর্শী।
Reasoning and science – গণিত এবং গবেষণার জন্য GPT-5.6 Sol এবং Gemini 3.1 Pro ছিল সেরা পছন্দ।
Maximum value – ওপেন-ওয়েট (Open-weight) চীনা মডেল—GLM-5.2 এবং DeepSeek V4—ফ্ল্যাগশিপ মডেলগুলোর তুলনায় অনেক কম টোকেন মূল্যে ফ্রন্টিয়ার-লেভেল কোয়ালিটি অর্জন করেছে। যেসব টিম সামান্য মানের ঘাটতি মেনে নিতে পারে, তারা সবচেয়ে সাশ্রয়ী সমাধান পায়।
Open-weight leaders – Kimi K3 বর্তমানে সবচেয়ে শক্তিশালী ওপেনলি রিলিজ করা মডেল হিসেবে দাঁড়িয়ে আছে। Meta-র Llama 4 পিছিয়ে পড়েছে।
মূল কথা হলো: কোনো নির্দিষ্ট কাজের জন্য "সবচেয়ে বুদ্ধিমান" মডেলটি সবসময় সবচেয়ে সাশ্রয়ী বা দ্রুততম নাও হতে পারে।
প্রোডাকশন সিস্টেমের জন্য রাউটিং কৌশল
- Route, don’t standardize – মডেল নির্বাচনকে একটি ডায়নামিক সিদ্ধান্ত হিসেবে বিবেচনা করুন, কোনো স্থির ডিফল্ট হিসেবে নয়।
- Default cheap, escalate on failure – সবচেয়ে কম খরচের মডেল দিয়ে কাজ শুরু করুন যা কাজটি করতে সক্ষম; যদি সেটি ব্যর্থ হয়, তবে উচ্চতর স্তরের মডেলে চলে যান।
- Separate planner from worker – একটি শক্তিশালী রিজনিং মডেল (যেমন, Opus 5) ব্যবহার করে সমস্যাটিকে ধাপে ধাপে ভাগ করুন, তারপর পুনরাবৃত্তিমূলক সাব-টাস্কগুলো একটি সস্তা এক্সিকিউটর (যেমন, Gemini Flash)-এর কাছে হস্তান্তর করুন।
- Measure success, not just token usage – একটি সস্তা মডেল যা তিনবার চেষ্টা (retry) করে, সেটি প্রথমবারেই সঠিক উত্তর দিতে পারে এমন একটি দামী মডেলের চেয়ে বেশি খরচ করতে পারে।
পরবর্তীতে যা খেয়াল রাখতে হবে
ডেভেলপারদের উচিত রাউটিং ম্যাপটিকে একটি জীবন্ত ডকুমেন্ট হিসেবে বিবেচনা করা এবং প্রতিটি বড় রিলিজের সাথে মডেলের পছন্দগুলো পুনরায় যাচাই করা।
সারসংক্ষেপ
২০২৬ সালে প্রতিযোগিতামূলক সুবিধা তাদেরই থাকবে যারা LLM-কে একটি একক সুইস-আর্মি নাইফ হিসেবে না দেখে একটি টুলবক্স হিসেবে বিবেচনা করবে। কাজের ধরন অনুযায়ী সেরা মডেলটি বেছে নেওয়ার মাধ্যমে প্রতিষ্ঠানগুলো এআই (AI) খরচ কমিয়ে দ্রুত ফলাফল দিতে পারবে। আসল জয় কোনো নতুন হেডলাইন মডেলের নয়; বরং এটি একটি সুশৃঙ্খল রাউটিং কৌশল যা সঠিক বুদ্ধিমত্তাকে সঠিক স্থানে পৌঁছে দেয়।
