Alibaba از Qwen3.8-Max رونمایی کرد؛ یک مدل Mixture-of-Experts (MoE) با ۲.۴ تریلیون پارامتر که در بنچمارک OSWorld-Verified موفقیت ۸۶.۱ درصدی را ثبت کرده است. طبق گفته Alibaba، این امتیاز از GPT-5.6، Sol Max و Fable 5 نیز فراتر رفته است. این بنچمارک توانایی یک هوش مصنوعی در تعامل با سیستمعامل، نصب نرمافزار و عیبیابی کد را میسنجد؛ مجموعهای از مهارتها که زیربنای عاملهای خودگردان مهندسی نرمافزار را تشکیل میدهند.
رقابت برای دستیابی به عاملهای خودگردان
مدلهای زبانی بزرگ از دستیارهای سبک چت به ابزارهایی تبدیل شدهاند که میتوانند کد بنویسند، آن را آزمایش کنند و حتی مستقر (deploy) کنند. شرکتهایی که بتوانند کارهای مهندسی روتین را بهطور قابلاعتمادی به یک هوش مصنوعی واگذار کنند، پتانسیل کاهش هزینههای نیروی انسانی و تسریع چرخههای محصول را خواهند داشت. بنچمارک OSWorld-Verified به یک معیار عملی برای سنجش قابلیت «عاملگونه» (agentic) تبدیل شده است، زیرا چیزی فراتر از تولید متن ایستا را میطلبد؛ این بنچمارک مستلزم تعامل واقعی با یک سیستم است.
آنچه Qwen3.8-Max ارائه میدهد
- معماری MoE با ۲.۴ تریلیون پارامتر – برای هر توکن میتوان تا ۶۴ زیرشبکه متخصص را مورد مشورت قرار داد؛ طراحیای که Alibaba ادعا میکند هزینههای محاسباتی را تقریباً ۴۰٪ کاهش میدهد.
- مدیریت پرامپتهای چندوجهی (Multimodal) – این مدل متن، تصاویر و دادههای ساختاریافته را بهطور همزمان میپذیرد و اجازه میدهد یک درخواست واحد، یک رابط کاربری (UI) را توصیف کند، اسکرینشات نشان دهد و فایلهای پیکربندی را ارائه کند.
- پنجره بافت (context window) ۶۴ هزار توکنی – فضای کافی برای کل پایگاههای کد، فایلهای لاگ یا گزارشهای فنی طولانی بدون نیاز به تکهتکه کردن آنها فراهم میکند.
این ویژگیها جریانهای کاری «سرتاسری» (end-to-end) را هدف قرار میدهند که تیمهای نرمافزاری ساعتها وقت خود را صرف آنها میکنند: فراخوانی وابستگیها، اسکن لاگها، رفع باگها و تولید مستندات.
بررسی دقیق اعداد و ارقام
| وظیفه | معیار گزارششده |
|---|---|
| OSWorld-Verified (تعامل عاملگونه با سیستمعامل) | ۸۶.۱٪ موفقیت |
| تولید کد (HumanEval-Plus) | ۷۸.۴٪ عبور |
| استدلال چندوجهی (MM-Bench) | ۸۴.۳٪ |
| خلاصهسازی با بافت طولانی (تست ۵۰ هزار توکنی) | ۹۰.۲٪ |
تمام ارقام مربوط به تستهای داخلی Alibaba است. اگر این نتایج تایید شوند، این مدل یک API واحد را در اختیار سازمانها قرار میدهد که میتواند کد، تصاویر و اسناد بزرگ را مدیریت کند و در عین حال هزینههای استنتاج (inference) را کمتر از بسیاری از رقبای مدلهای متراکم (dense-model) نگه دارد.
ریسکها و نیاز به اعتبارسنجی مستقل
نبود تاییدیه شخص ثالث، فوریترین نکته قابل توجه است. بنچمارکها را میتوان تنظیم کرد، پرامپتها را بهینه کرد یا مجموعه دادههای تست را به نفع یک معماری خاص فیلتر کرد. بدون بازتولید خارجی، این ادعا که Qwen3.8-Max از GPT-5.6 «پیشی میگیرد» همچنان موقتی است. علاوه بر این، مدلهای MoE میتوانند عملکرد نابرابری داشته باشند: برخی توکنها ممکن است به سمت متخصصانی هدایت شوند که کمتر آموزش دیدهاند، که منجر به توهمهای (hallucinations) گاهبهگاه یا خروجیهای ناسازگار میشود؛ مسائلی که وقتی قرار است یک هوش مصنوعی سیستمهای عملیاتی (production) را اصلاح کند، بسیار حیاتی هستند.
آنچه باید در آینده زیر نظر داشت
- بازتولید مستقل – محققان و مشتریان ابری احتمالاً همان مجموعه OSWorld-Verified و تستهای HumanEval-Plus را روی سختافزارهای در دسترس عموم اجرا خواهند کرد.
- قیمتگذاری و تأخیر (latency) – قیمتگذاری API در Alibaba Cloud مشخص خواهد کرد که آیا صرفهجویی ۴۰ درصدی در محاسبات، به یک مزیت هزینه ملموس برای توسعهدهندگان تبدیل میشود یا خیر.
- ابزارهای ایمنی – با افزایش کنترل عاملهای خودگردان بر زیرساختها، اکوسیستم به مکانیزمهای نظارتی، بازگشت به حالت قبل (rollback) و حسابرسی نیاز خواهد داشت که هنوز در مراحل اولیه هستند.
اگر Qwen3.8-Max به اعداد اعلامشده خود عمل کند، شکاف بین یک دستیار گفتگومحور و یک ربات مهندسی خودکفا بهشدت کاهش مییابد. چند ماه آینده نشان خواهد داد که آیا عملکرد این مدل در برابر بررسیهای دقیق دوام میآورد و آیا سازمانها آن را به عنوان ستون فقرات خطوط لوله توسعه خودکار خود میپذیرند یا خیر.
