علیبابا از Qwen3.8-Max رونمایی کرد: غول ۲.۴ تریلیون پارامتری برای عاملهای هوش مصنوعی (AI Agents)
تیم Qwen در علیبابا از Qwen3.8-Max رونمایی کرد؛ یک مدل پرچمدار عظیم با ۲.۴ تریلیون پارامتر که برای فراتر رفتن از دستورات چت ساده و حرکت به سمت استدلال خودگردان در بازههای زمانی طولانی (long-horizon) طراحی شده است. این مدل با تمرکز بر جریانهای کاری چندروزه و اجرای وظایف پیچیده، نشاندهنده تغییری بزرگ از مدلهای زبانی بزرگ (LLMs) واکنشی به سمت عاملهای هوش مصنوعی (AI agents) پیشکننده است.
مقیاسپذیری پارامترها برای هوش خودگردان
Qwen3.8-Max یک قدرت فنی تمامعیار است که از مجموع ۲.۴ تریلیون پارامتر، با ۹۵ میلیارد پارامتر فعال در هر پرسوجو استفاده میکند. این مدل با تکیه بر معماری Qwen3.5، بهطور ویژه برای وظایف «long-horizon» یا همان اهداف پیچیدهای بهینهسازی شده است که مستلزم فعالیت مستقل هوش مصنوعی در طول روزها یا حتی هفتههاست.
در اقدامی مهم برای جامعه متنباز (open-source)، علیبابا تأیید کرده است که وزنهای (weights) کلاس Qwen-Max هفته آینده بهصورت عمومی در دسترس قرار خواهد گرفت؛ اقدامی که سلطه مدلهای بسته و انحصاری مانند GPT و Claude را به چالش میکشد.
اثبات خودگردانی از طریق کدنویسی و تحقیق
علیبابا برای نمایش قابلیتهای عاملگونه (agentic) خود، چندین مطالعه موردی حساس را ارائه کرد که در آنها مدل بدون دخالت انسان عمل کرده است:
- مهندسی نرمافزار: در یک بازه ۱۶ روزه، Qwen3.8-Max بهطور خودگردان ابزار خط فرمان
oh-my-cliرا توسعه داد. این مدل مسائل (issues) گیتهاب خود را مدیریت کرد، کد نوشت، تستها را اجرا کرد و ۲۶۵ کامیت (commit) و ۱۲۷ درخواست ادغام (pull request) را انجام داد. - بازتولید علمی: با مأموریت بازتولید نتایج مقاله "Unified Data Selection for LLM Reasoning"، این مدل ۱۲۵ ساعت زمان محاسباتی را صرف نوشتن ۷۶۰۰ خط کد کرد. این مدل نه تنها تحقیق اصلی را بازسازی کرد، بلکه امتیاز بنچمارک ریاضی AIME24 را ۲.۷ امتیاز بهبود بخشید.
- علم داده رقابتی: در چالش تشخیص قصد گفتگوی چندوجهی WWW2025، این مدل از ۴۵۸ تیم انسانی از مجموع ۵۲۶ تیم پیشی گرفت و دقت خود را ظرف ۲۴ ساعت از ۰.۶۰ به ۰.۸۵۳ رساند.
فراتر از نرمافزار: طراحی تراشه و شبیهسازی مالی
استدلال Qwen3.8-Max به حوزههای سختافزار و اقتصاد نیز گسترش یافته است. در یک وظیفه طراحی مدار رمزنگاری، این مدل بهصورت تکرارشونده یک طراحی «حجیم» را از ۸۲۹۸ گیت منطقی به تنها ۶۷۸ گیت کاهش داد. با استفاده از ابزار OpenROAD، این کار منجر به کاهش ۸۱ درصدی در مساحت فیزیکی تراشه شد.
در یک شبیهسازی پیچیده خردهفروشی به نام E-Commerce-Bench، این مدل چندین فروشگاه آنلاین را در طول یک سال مالی شبیهسازی شده مدیریت کرد. با شروع از ۱۰۰,۰۰۰ یوان، این مدل مذاکرات با تأمینکنندگان را هدایت کرد، ۱۵۲ کلاهبردار را شناسایی نمود و اختلالات زنجیره تأمین را مدیریت کرد تا در نهایت با ۴۱۶,۲۵۲ یوان کار خود را تمام کند؛ یعنی چهار برابر کردن سرمایه اولیه و عملکردی بسیار بهتر از رقیب دوم، GLM 5.2.
مرزهای چندوجهی و تسلط بر بنچمارکها
این مدل همچنین مرزهای پردازش چندوجهی را جابهجا میکند و قادر به مدیریت اسناد ۲۰۰ صفحهای و ویدئوهای بیش از ۱۰۰ ساعت است. علیبابا همچنین در حال معرفی RecreationBench است؛ بنچمارکی که توانایی یک عامل را در بازسازی برنامههای در حال اجرا (در ویندوز، macOS، اندروید و غیره) صرفاً از طریق تعامل بصری و کیبورد، بدون دسترسی به کد منبع، آزمایش میکند.
طبق بنچمارکهای داخلی، Qwen3.8-Max مستقیماً با مدلهای سطح اول رقابت میکند و در چندین دسته، در نزدیکی یا بالاتر از Claude Opus 4.8 و GPT-5.6 Sol قرار میگیرد، از جمله کسب امتیاز پیشرو ۹۳ در PaperBench.
نکات کلیدی
- مقیاس عظیم: Qwen3.8-Max دارای ۲.۴ تریلیون پارامتر کل و ۹۵ میلیارد پارامتر فعال است که برای جریانهای کاری خودگردان چندروزه بهینهسازی شده است.
- تسلط بر قابلیتهای عاملی: این مدل توانایی مدیریت پیچیده مهندسی نرمافزار، بهینهسازی طراحی تراشه و مدیریت مالی در مقیاس کامل را بهصورت خودگردان نشان داده است.
- تأثیر وزنهای باز: برخلاف بسیاری از مدلهای پیشرو، علیبابا قصد دارد وزنهای کلاس Qwen-Max را منتشر کند و دسترسی بیسابقهای را برای توسعهدهندگان به هوش عاملی سطح بالا فراهم کند.
