علی‌بابا از Qwen3.8-Max رونمایی کرد: غول ۲.۴ تریلیون پارامتری برای عامل‌های هوش مصنوعی (AI Agents)

تیم Qwen در علی‌بابا از Qwen3.8-Max رونمایی کرد؛ یک مدل پرچم‌دار عظیم با ۲.۴ تریلیون پارامتر که برای فراتر رفتن از دستورات چت ساده و حرکت به سمت استدلال خودگردان در بازه‌های زمانی طولانی (long-horizon) طراحی شده است. این مدل با تمرکز بر جریان‌های کاری چندروزه و اجرای وظایف پیچیده، نشان‌دهنده تغییری بزرگ از مدل‌های زبانی بزرگ (LLMs) واکنشی به سمت عامل‌های هوش مصنوعی (AI agents) پیش‌کننده است.

مقیاس‌پذیری پارامترها برای هوش خودگردان

Qwen3.8-Max یک قدرت فنی تمام‌عیار است که از مجموع ۲.۴ تریلیون پارامتر، با ۹۵ میلیارد پارامتر فعال در هر پرس‌وجو استفاده می‌کند. این مدل با تکیه بر معماری Qwen3.5، به‌طور ویژه برای وظایف «long-horizon» یا همان اهداف پیچیده‌ای بهینه‌سازی شده است که مستلزم فعالیت مستقل هوش مصنوعی در طول روزها یا حتی هفته‌هاست.

در اقدامی مهم برای جامعه متن‌باز (open-source)، علی‌بابا تأیید کرده است که وزن‌های (weights) کلاس Qwen-Max هفته آینده به‌صورت عمومی در دسترس قرار خواهد گرفت؛ اقدامی که سلطه مدل‌های بسته و انحصاری مانند GPT و Claude را به چالش می‌کشد.

اثبات خودگردانی از طریق کدنویسی و تحقیق

علی‌بابا برای نمایش قابلیت‌های عامل‌گونه (agentic) خود، چندین مطالعه موردی حساس را ارائه کرد که در آن‌ها مدل بدون دخالت انسان عمل کرده است:

  • مهندسی نرم‌افزار: در یک بازه ۱۶ روزه، Qwen3.8-Max به‌طور خودگردان ابزار خط فرمان oh-my-cli را توسعه داد. این مدل مسائل (issues) گیت‌هاب خود را مدیریت کرد، کد نوشت، تست‌ها را اجرا کرد و ۲۶۵ کامیت (commit) و ۱۲۷ درخواست ادغام (pull request) را انجام داد.
  • بازتولید علمی: با مأموریت بازتولید نتایج مقاله "Unified Data Selection for LLM Reasoning"، این مدل ۱۲۵ ساعت زمان محاسباتی را صرف نوشتن ۷۶۰۰ خط کد کرد. این مدل نه تنها تحقیق اصلی را بازسازی کرد، بلکه امتیاز بنچمارک ریاضی AIME24 را ۲.۷ امتیاز بهبود بخشید.
  • علم داده رقابتی: در چالش تشخیص قصد گفتگوی چندوجهی WWW2025، این مدل از ۴۵۸ تیم انسانی از مجموع ۵۲۶ تیم پیشی گرفت و دقت خود را ظرف ۲۴ ساعت از ۰.۶۰ به ۰.۸۵۳ رساند.

فراتر از نرم‌افزار: طراحی تراشه و شبیه‌سازی مالی

استدلال Qwen3.8-Max به حوزه‌های سخت‌افزار و اقتصاد نیز گسترش یافته است. در یک وظیفه طراحی مدار رمزنگاری، این مدل به‌صورت تکرارشونده یک طراحی «حجیم» را از ۸۲۹۸ گیت منطقی به تنها ۶۷۸ گیت کاهش داد. با استفاده از ابزار OpenROAD، این کار منجر به کاهش ۸۱ درصدی در مساحت فیزیکی تراشه شد.

در یک شبیه‌سازی پیچیده خرده‌فروشی به نام E-Commerce-Bench، این مدل چندین فروشگاه آنلاین را در طول یک سال مالی شبیه‌سازی شده مدیریت کرد. با شروع از ۱۰۰,۰۰۰ یوان، این مدل مذاکرات با تأمین‌کنندگان را هدایت کرد، ۱۵۲ کلاهبردار را شناسایی نمود و اختلالات زنجیره تأمین را مدیریت کرد تا در نهایت با ۴۱۶,۲۵۲ یوان کار خود را تمام کند؛ یعنی چهار برابر کردن سرمایه اولیه و عملکردی بسیار بهتر از رقیب دوم، GLM 5.2.

مرزهای چندوجهی و تسلط بر بنچمارک‌ها

این مدل همچنین مرزهای پردازش چندوجهی را جابه‌جا می‌کند و قادر به مدیریت اسناد ۲۰۰ صفحه‌ای و ویدئوهای بیش از ۱۰۰ ساعت است. علی‌بابا همچنین در حال معرفی RecreationBench است؛ بنچمارکی که توانایی یک عامل را در بازسازی برنامه‌های در حال اجرا (در ویندوز، macOS، اندروید و غیره) صرفاً از طریق تعامل بصری و کیبورد، بدون دسترسی به کد منبع، آزمایش می‌کند.

طبق بنچمارک‌های داخلی، Qwen3.8-Max مستقیماً با مدل‌های سطح اول رقابت می‌کند و در چندین دسته، در نزدیکی یا بالاتر از Claude Opus 4.8 و GPT-5.6 Sol قرار می‌گیرد، از جمله کسب امتیاز پیشرو ۹۳ در PaperBench.

نکات کلیدی

  • مقیاس عظیم: Qwen3.8-Max دارای ۲.۴ تریلیون پارامتر کل و ۹۵ میلیارد پارامتر فعال است که برای جریان‌های کاری خودگردان چندروزه بهینه‌سازی شده است.
  • تسلط بر قابلیت‌های عاملی: این مدل توانایی مدیریت پیچیده مهندسی نرم‌افزار، بهینه‌سازی طراحی تراشه و مدیریت مالی در مقیاس کامل را به‌صورت خودگردان نشان داده است.
  • تأثیر وزن‌های باز: برخلاف بسیاری از مدل‌های پیشرو، علی‌بابا قصد دارد وزن‌های کلاس Qwen-Max را منتشر کند و دسترسی بی‌سابقه‌ای را برای توسعه‌دهندگان به هوش عاملی سطح بالا فراهم کند.