Alibaba তাদের Qwen3.8-Max উন্মোচন করেছে, যা একটি ২.৪ ট্রিলিয়ন-প্যারামিটার বিশিষ্ট Mixture-of-Experts (MoE) মডেল। এটি OSWorld-Verified বেঞ্চমার্কে ৮৬.১% সাফল্যের হার প্রদর্শন করেছে—Alibaba-র দাবি অনুযায়ী এই স্কোর GPT-5.6, Sol Max এবং Fable 5-কে ছাড়িয়ে গেছে। এই বেঞ্চমার্কটি একটি অপারেটিং সিস্টেমের সাথে ইন্টারঅ্যাক্ট করা, সফটওয়্যার ইনস্টল করা এবং কোড ডিবাগ করার মতো AI-এর সক্ষমতা পরিমাপ করে, যা মূলত স্বায়ত্তশাসিত (autonomous) সফটওয়্যার-ইঞ্জিনিয়ারিং এজেন্টগুলোর মূল ভিত্তি।

স্বায়ত্তশাসিত এজেন্টের দৌড়

লার্জ ল্যাঙ্গুয়েজ মডেলগুলো এখন চ্যাট-স্টাইল অ্যাসিস্ট্যান্ট থেকে এমন টুলে রূপান্তরিত হয়েছে যা কোড লিখতে, পরীক্ষা করতে এমনকি ডেপ্লয় (deploy) করতেও সক্ষম। যেসব কোম্পানি নির্ভরযোগ্যভাবে রুটিন ইঞ্জিনিয়ারিং কাজগুলো AI-এর হাতে ছেড়ে দিতে পারবে, তারা কর্মী খরচ কমাতে এবং প্রোডাক্ট সাইকেল দ্রুত করতে সক্ষম হবে। OSWorld-Verified বেঞ্চমার্কটি "agentic" সক্ষমতার একটি ডি-ফ্যাক্টো (de-facto) মানদণ্ড হয়ে উঠেছে, কারণ এটি কেবল স্ট্যাটিক টেক্সট জেনারেশনের চেয়ে বেশি কিছু দাবি করে; এটি একটি সিস্টেমের সাথে বাস্তব জগতের মিথস্ক্রিয়া প্রয়োজন করে।

Qwen3.8-Max যা নিয়ে আসছে

  • ২.৪ ট্রিলিয়ন প্যারামিটার বিশিষ্ট MoE আর্কিটেকচার – প্রতিটি টোকেনের জন্য ৬৪টি পর্যন্ত বিশেষজ্ঞ সাব-নেটওয়ার্ক ব্যবহার করা যেতে পারে; Alibaba-র দাবি অনুযায়ী এই ডিজাইনটি কম্পিউট খরচ প্রায় ৪০% কমিয়ে দেয়।
  • মাল্টিমোডাল প্রম্পট হ্যান্ডলিং – মডেলটি টেক্সট, ইমেজ এবং স্ট্রাকচার্ড ডেটা একসাথে গ্রহণ করতে পারে, যার ফলে একটি মাত্র রিকোয়েস্টের মাধ্যমেই একটি UI বর্ণনা করা, স্ক্রিনশট দেখানো এবং কনফিগারেশন ফাইল সরবরাহ করা সম্ভব।
  • ৬৪k টোকেন কনটেক্সট উইন্ডো – সম্পূর্ণ কোডবেস, লগ ফাইল বা দীর্ঘ টেকনিক্যাল রিপোর্টগুলোকে খণ্ড খণ্ড না করেই এতে রাখা সম্ভব।

এই ফিচারগুলো সেই সব "end-to-end" ওয়ার্কফ্লোকে লক্ষ্য করে যা সফটওয়্যার টিমগুলোর ঘণ্টার পর ঘণ্টা সময় ব্যয় করতে হয়: ডিপেন্ডেন্সি টানা (pulling dependencies), লগ স্ক্যান করা, বাগ প্যাচ করা এবং ডকুমেন্টেশন তৈরি করা।

সূক্ষ্মভাবে বিশ্লেষণ করা সংখ্যাগুলো

কাজ (Task) রিপোর্ট করা মেট্রিক (Reported metric)
OSWorld-Verified (agentic OS interaction) ৮৬.১% সাফল্য
Code generation (HumanEval-Plus) ৭৮.৪% পাস
Multimodal reasoning (MM-Bench) ৮৪.৩%
Long-context summarization (50 k-token test) ৯০.২%

এই সমস্ত পরিসংখ্যান Alibaba-র অভ্যন্তরীণ টেস্টিং থেকে নেওয়া হয়েছে। যদি এগুলো বজায় থাকে, তবে এই মডেলটি এন্টারপ্রাইজগুলোর জন্য এমন একটি একক API প্রদান করবে যা কোড, ইমেজ এবং বড় ডকুমেন্ট হ্যান্ডেল করতে পারবে এবং একই সাথে অনেক ডেন্স-মডেল (dense-model) প্রতিযোগীর তুলনায় ইনফারেন্স খরচও কম রাখবে।

ঝুঁকি এবং স্বাধীন যাচাইকরণের প্রয়োজনীয়তা

তৃতীয় পক্ষের যাচাইকরণের অনুপস্থিতি হলো সবচেয়ে তাৎক্ষণিক সতর্কতা। বেঞ্চমার্কগুলো টিউন করা যেতে পারে, প্রম্পট অপ্টিমাইজ করা যেতে পারে বা কোনো নির্দিষ্ট আর্কিটেকচারকে সুবিধা দেওয়ার জন্য টেস্ট সেট ফিল্টার করা যেতে পারে। বাহ্যিক পুনরুৎপাদন (external replication) ছাড়া Qwen3.8-Max যে GPT-5.6-কে "হারিয়ে দিচ্ছে", এই দাবিটি সাময়িক বা অনিশ্চিত। তদুপরি, MoE মডেলগুলো অসম পারফরম্যান্স দেখাতে পারে: কিছু টোকেন হয়তো কম প্রশিক্ষিত বিশেষজ্ঞের কাছে চলে যেতে পারে, যার ফলে মাঝে মাঝে হ্যালুসিনেশন (hallucination) বা অসংলগ্ন আউটপুট আসতে পারে—এমন সমস্যা যা অত্যন্ত গুরুত্বপূর্ণ যখন একটি AI-এর কাছ থেকে প্রোডাকশন সিস্টেম পরিবর্তন করার প্রত্যাশা করা হয়।

পরবর্তীতে যা লক্ষ্য রাখতে হবে

  • স্বাধীন পুনরুৎপাদন (Independent replication) – গবেষক এবং ক্লাউড গ্রাহকরা সম্ভবত পাবলিকলি উপলব্ধ হার্ডওয়্যারে একই OSWorld-Verified স্যুট এবং HumanEval-Plus টেস্ট চালাবেন।
  • মূল্য এবং ল্যাটেন্সি (Latency) – Alibaba Cloud-এর API প্রাইসিং থেকে জানা যাবে যে ৪০% কম্পিউট সাশ্রয় ডেভেলপারদের জন্য বাস্তবসম্মত খরচ সাশ্রয়ে রূপান্তরিত হয় কিনা।
  • নিরাপত্তার জন্য টুলস – যেহেতু স্বায়ত্তশাসিত এজেন্টগুলো ইনফ্রাস্ট্রাকচারের ওপর আরও বেশি নিয়ন্ত্রণ পাচ্ছে, তাই ইকোসিস্টেমের জন্য মনিটরিং, রোলব্যাক এবং অডিট মেকানিজম প্রয়োজন হবে যা এখনও প্রাথমিক পর্যায়ে রয়েছে।

যদি Qwen3.8-Max তার শিরোনামের সংখ্যাগুলো পূরণ করতে পারে, তবে একটি কথোপকথনমূলক অ্যাসিস্ট্যান্ট এবং একটি স্বয়ংসম্পূর্ণ ইঞ্জিনিয়ারিং বটের মধ্যকার ব্যবধান নাটকীয়ভাবে কমে আসবে। আগামী কয়েক মাস দেখাবে যে মডেলটির পারফরম্যান্স যাচাইকরণে টিকে থাকে কিনা এবং এন্টারপ্রাইজগুলো এটিকে তাদের স্বয়ংক্রিয় ডেভেলপমেন্ট পাইপলাইনের মেরুদণ্ড হিসেবে গ্রহণ করে কিনা।