Alibaba از Qwen3.8-Max رونمایی کرد؛ یک مدل Mixture-of-Experts (MoE) با ۲.۴ تریلیون پارامتر که در بنچمارک OSWorld-Verified موفقیت ۸۶.۱ درصدی را ثبت کرده است. طبق گفته Alibaba، این امتیاز از GPT-5.6، Sol Max و Fable 5 نیز فراتر رفته است. این بنچمارک توانایی یک هوش مصنوعی در تعامل با سیستم‌عامل، نصب نرم‌افزار و عیب‌یابی کد را می‌سنجد؛ مجموعه‌ای از مهارت‌ها که زیربنای عامل‌های خودگردان مهندسی نرم‌افزار را تشکیل می‌دهند.

رقابت برای دستیابی به عامل‌های خودگردان

مدل‌های زبانی بزرگ از دستیارهای سبک چت به ابزارهایی تبدیل شده‌اند که می‌توانند کد بنویسند، آن را آزمایش کنند و حتی مستقر (deploy) کنند. شرکت‌هایی که بتوانند کارهای مهندسی روتین را به‌طور قابل‌اعتمادی به یک هوش مصنوعی واگذار کنند، پتانسیل کاهش هزینه‌های نیروی انسانی و تسریع چرخه‌های محصول را خواهند داشت. بنچمارک OSWorld-Verified به یک معیار عملی برای سنجش قابلیت «عامل‌گونه» (agentic) تبدیل شده است، زیرا چیزی فراتر از تولید متن ایستا را می‌طلبد؛ این بنچمارک مستلزم تعامل واقعی با یک سیستم است.

آنچه Qwen3.8-Max ارائه می‌دهد

  • معماری MoE با ۲.۴ تریلیون پارامتر – برای هر توکن می‌توان تا ۶۴ زیرشبکه متخصص را مورد مشورت قرار داد؛ طراحی‌ای که Alibaba ادعا می‌کند هزینه‌های محاسباتی را تقریباً ۴۰٪ کاهش می‌دهد.
  • مدیریت پرامپت‌های چندوجهی (Multimodal) – این مدل متن، تصاویر و داده‌های ساختاریافته را به‌طور هم‌زمان می‌پذیرد و اجازه می‌دهد یک درخواست واحد، یک رابط کاربری (UI) را توصیف کند، اسکرین‌شات نشان دهد و فایل‌های پیکربندی را ارائه کند.
  • پنجره بافت (context window) ۶۴ هزار توکنی – فضای کافی برای کل پایگاه‌های کد، فایل‌های لاگ یا گزارش‌های فنی طولانی بدون نیاز به تکه‌تکه کردن آن‌ها فراهم می‌کند.

این ویژگی‌ها جریان‌های کاری «سرتاسری» (end-to-end) را هدف قرار می‌دهند که تیم‌های نرم‌افزاری ساعت‌ها وقت خود را صرف آن‌ها می‌کنند: فراخوانی وابستگی‌ها، اسکن لاگ‌ها، رفع باگ‌ها و تولید مستندات.

بررسی دقیق اعداد و ارقام

وظیفه معیار گزارش‌شده
OSWorld-Verified (تعامل عامل‌گونه با سیستم‌عامل) ۸۶.۱٪ موفقیت
تولید کد (HumanEval-Plus) ۷۸.۴٪ عبور
استدلال چندوجهی (MM-Bench) ۸۴.۳٪
خلاصه‌سازی با بافت طولانی (تست ۵۰ هزار توکنی) ۹۰.۲٪

تمام ارقام مربوط به تست‌های داخلی Alibaba است. اگر این نتایج تایید شوند، این مدل یک API واحد را در اختیار سازمان‌ها قرار می‌دهد که می‌تواند کد، تصاویر و اسناد بزرگ را مدیریت کند و در عین حال هزینه‌های استنتاج (inference) را کمتر از بسیاری از رقبای مدل‌های متراکم (dense-model) نگه دارد.

ریسک‌ها و نیاز به اعتبارسنجی مستقل

نبود تاییدیه شخص ثالث، فوری‌ترین نکته قابل توجه است. بنچمارک‌ها را می‌توان تنظیم کرد، پرامپت‌ها را بهینه کرد یا مجموعه‌ داده‌های تست را به نفع یک معماری خاص فیلتر کرد. بدون بازتولید خارجی، این ادعا که Qwen3.8-Max از GPT-5.6 «پیشی می‌گیرد» همچنان موقتی است. علاوه بر این، مدل‌های MoE می‌توانند عملکرد نابرابری داشته باشند: برخی توکن‌ها ممکن است به سمت متخصصانی هدایت شوند که کمتر آموزش دیده‌اند، که منجر به توهم‌های (hallucinations) گاه‌به‌گاه یا خروجی‌های ناسازگار می‌شود؛ مسائلی که وقتی قرار است یک هوش مصنوعی سیستم‌های عملیاتی (production) را اصلاح کند، بسیار حیاتی هستند.

آنچه باید در آینده زیر نظر داشت

  • بازتولید مستقل – محققان و مشتریان ابری احتمالاً همان مجموعه OSWorld-Verified و تست‌های HumanEval-Plus را روی سخت‌افزارهای در دسترس عموم اجرا خواهند کرد.
  • قیمت‌گذاری و تأخیر (latency) – قیمت‌گذاری API در Alibaba Cloud مشخص خواهد کرد که آیا صرفه‌جویی ۴۰ درصدی در محاسبات، به یک مزیت هزینه ملموس برای توسعه‌دهندگان تبدیل می‌شود یا خیر.
  • ابزارهای ایمنی – با افزایش کنترل عامل‌های خودگردان بر زیرساخت‌ها، اکوسیستم به مکانیزم‌های نظارتی، بازگشت به حالت قبل (rollback) و حسابرسی نیاز خواهد داشت که هنوز در مراحل اولیه هستند.

اگر Qwen3.8-Max به اعداد اعلام‌شده خود عمل کند، شکاف بین یک دستیار گفتگو‌محور و یک ربات مهندسی خودکفا به‌شدت کاهش می‌یابد. چند ماه آینده نشان خواهد داد که آیا عملکرد این مدل در برابر بررسی‌های دقیق دوام می‌آورد و آیا سازمان‌ها آن را به عنوان ستون فقرات خطوط لوله توسعه خودکار خود می‌پذیرند یا خیر.