Alibaba উন্মোচন করল Qwen3.8-Max: AI এজেন্টদের জন্য ২.৪ ট্রিলিয়ন প্যারামিটারের এক দানবীয় মডেল
Alibaba-র Qwen টিম Qwen3.8-Max ঘোষণা করেছে, যা একটি বিশাল ২.৪ ট্রিলিয়ন প্যারামিটারের ফ্ল্যাগশিপ মডেল। এটি সাধারণ চ্যাট প্রম্পটের গণ্ডি পেরিয়ে দীর্ঘমেয়াদী স্বায়ত্তশাসিত যুক্তিনির্ভরতা (long-horizon autonomous reasoning) প্রদানের জন্য ডিজাইন করা হয়েছে। বহু-দিনের ওয়ার্কফ্লো এবং জটিল কাজ সম্পাদনার ওপর গুরুত্বারোপ করার মাধ্যমে, এই মডেলটি রিঅ্যাক্টিভ LLM থেকে প্রোঅ্যাক্টিভ AI এজেন্টে একটি উল্লেখযোগ্য পরিবর্তন চিহ্নিত করে।
স্বায়ত্তশাসিত বুদ্ধিমত্তার জন্য প্যারামিটার স্কেলিং
Qwen3.8-Max একটি প্রযুক্তিগত পাওয়ারহাউস, যা মোট ২.৪ ট্রিলিয়ন প্যারামিটার ব্যবহার করে এবং প্রতি কোয়েরিতে ৯৫ বিলিয়ন অ্যাক্টিভ প্যারামিটার কাজ করে। Qwen3.5 আর্কিটেকচারের ওপর ভিত্তি করে তৈরি এই মডেলটি বিশেষভাবে "long-horizon" বা দীর্ঘমেয়াদী কাজের জন্য অপ্টিমাইজ করা হয়েছে—এমন জটিল লক্ষ্য যা সম্পন্ন করতে AI-কে কয়েক দিন বা এমনকি কয়েক সপ্তাহ ধরে স্বাধীনভাবে কাজ করতে হয়।
ওপেন-সোর্স কমিউনিটির জন্য একটি গুরুত্বপূর্ণ পদক্ষেপ হিসেবে, Alibaba নিশ্চিত করেছে যে আগামী সপ্তাহে Qwen-Max ক্লাসের ওয়েটস (weights) জনসমক্ষে উন্মুক্ত করা হবে, যা GPT এবং Claude-এর মতো ফ্রন্টিয়ার মডেলগুলোর একচেটিয়া আধিপত্যকে চ্যালেঞ্জ জানাবে।
কোডিং এবং গবেষণার মাধ্যমে স্বায়ত্তশাসন প্রমাণ
এর এজেন্টিক ক্ষমতা প্রদর্শনের জন্য, Alibaba বেশ কিছু উচ্চ-ঝুঁকিপূর্ণ কেস স্টাডি উপস্থাপন করেছে যেখানে মডেলটি মানুষের হস্তক্ষেপ ছাড়াই কাজ করেছে:
- Software Engineering: ১৬ দিনের একটি সময়ের মধ্যে, Qwen3.8-Max স্বায়ত্তশাসিতভাবে কমান্ড-লাইন টুল
oh-my-cliতৈরি করেছে। এটি নিজেই নিজের GitHub ইস্যুগুলো পরিচালনা করেছে, কোড লিখেছে, টেস্ট চালিয়েছে এবং ২৬৫টি কমিট ও ১২৭টি পুল রিকোয়েস্ট সম্পন্ন করেছে। - Scientific Reproduction: "Unified Data Selection for LLM Reasoning" পেপারটির ফলাফল পুনরুৎপাদন করার tasked হিসেবে, মডেলটি ৭,৬০০ লাইন কোড লিখতে ১২৫ ঘণ্টা কম্পিউট টাইম ব্যয় করেছে। এটি কেবল মূল গবেষণাটিকেই প্রতিলিপি করেনি, বরং AIME24 ম্যাথ বেঞ্চমার্ক স্কোর ২.৭ পয়েন্ট বৃদ্ধি করেছে।
- Competitive Data Science: WWW2025 Multimodal Dialogue Intent Recognition Challenge-এ, মডেলটি ৫২৬টি মানব দলের মধ্যে ৪৫৮টি দলকে ছাড়িয়ে গেছে এবং ২৪ ঘণ্টার মধ্যে এর নির্ভুলতা (accuracy) ০.৬০ থেকে বাড়িয়ে ০.৮৫৩ করেছে।
সফটওয়্যারের বাইরে: চিপ ডিজাইন এবং আর্থিক সিমুলেশন
Qwen3.8-Max-এর যুক্তিনির্ভরতা হার্ডওয়্যার এবং অর্থনীতির ক্ষেত্রেও বিস্তৃত। একটি ক্রিপ্টোগ্রাফিক সার্কিট ডিজাইন টাস্কে, মডেলটি একটি "bloated" বা অতিরিক্ত জটিল ডিজাইনকে ধাপে ধাপে ৮,২৯৮টি লজিক গেট থেকে কমিয়ে মাত্র ৬৭৮টি গেটে নিয়ে এসেছে। OpenROAD টুল ব্যবহার করে, এর ফলে ফিজিক্যাল চিপ এরিয়া ৮১% হ্রাস পেয়েছে।
E-Commerce-Bench নামক একটি জটিল রিটেইল সিমুলেশনে, মডেলটি একটি কাল্পনিক অর্থবছর জুড়ে একাধিক অনলাইন স্টোর পরিচালনা করেছে। ১,০০,০০০ ইউয়ান দিয়ে শুরু করে, এটি সরবরাহকারীর সাথে দরকষাকষি করেছে, ১৫২ জন স্ক্যামার শনাক্ত করেছে এবং সাপ্লাই চেইন বিঘ্নিত হওয়া সামলে ৪,১৬,২৫২ ইউয়ান নিয়ে শেষ করেছে—যা এর প্রাথমিক মূলধনকে চারগুণ বাড়িয়ে দিয়েছে এবং রানার-আপ GLM 5.2-কে উল্লেখযোগ্যভাবে ছাড়িয়ে গেছে।
মাল্টিমোডাল ফ্রন্টিয়ার এবং বেঞ্চমার্ক আধিপত্য
মডেলটি মাল্টিমোডাল প্রসেসিংয়ের সীমানাকে আরও প্রসারিত করেছে, যা ২০০ পৃষ্ঠার ডকুমেন্ট এবং ১০০ ঘণ্টার বেশি দীর্ঘ ভিডিও হ্যান্ডেল করতে সক্ষম। Alibaba RecreationBench নামে একটি বেঞ্চমার্কও প্রবর্তন করছে, যা সোর্স কোড অ্যাক্সেস ছাড়াই শুধুমাত্র ভিজ্যুয়াল এবং কিবোর্ড ইন্টারঅ্যাকশনের মাধ্যমে চলমান অ্যাপ্লিকেশন (Windows, macOS, Android ইত্যাদিতে) পুনর্গঠন করার এজেন্টিক ক্ষমতা পরীক্ষা করে।
অভ্যন্তরীণ বেঞ্চমার্ক অনুযায়ী, Qwen3.8-Max সরাসরি শীর্ষস্থানীয় মডেলগুলোর সাথে প্রতিযোগিতা করছে এবং PaperBench-এ ৯৩ স্কোরসহ বেশ কিছু ক্যাটাগরিতে Claude Opus 4.8 এবং GPT-5.6 Sol-এর কাছাকাছি বা তার উপরে অবস্থান করছে।
মূল বিষয়সমূহ
- Massive Scale: Qwen3.8-Max-এ মোট ২.৪ ট্রিলিয়ন প্যারামিটার এবং ৯৫ বিলিয়ন অ্যাক্টিভ প্যারামিটার রয়েছে, যা বহু-দিনের স্বায়ত্তশাসিত ওয়ার্কফ্লোর জন্য অপ্টিমাইজ করা।
- Agentic Mastery: মডেলটি জটিল সফটওয়্যার ইঞ্জিনিয়ারিং, চিপ ডিজাইন অপ্টিমাইজেশন এবং পূর্ণাঙ্গ আর্থিক ব্যবস্থাপনা স্বায়ত্তশাসিতভাবে পরিচালনা করার ক্ষমতা প্রদর্শন করেছে।
- Open-Weight Impact: অনেক ফ্রন্টিয়ার মডেলের বিপরীতে, Alibaba Qwen-Max ক্লাসের ওয়েটস রিলিজ করার পরিকল্পনা করছে, যা ডেভেলপারদের উচ্চ-স্তরের এজেন্টিক ইন্টেলিজেন্সে অভূতপূর্ব অ্যাক্সেস প্রদান করবে।
