阿里巴巴推出了 Qwen3.8-Max,这是一款拥有 2.4 万亿参数的混合专家 (MoE) 模型,在 OSWorld-Verified 基准测试中取得了 86.1% 的成功率——阿里巴巴表示,这一得分超过了 GPT-5.6、Sol Max 和 Fable 5。该基准测试衡量 AI 与操作系统交互、安装软件和调试代码的能力,这些技能是自主软件工程智能体 (agents) 的基础。

自主智能体之争

大语言模型已从聊天式助手转变为能够编写、测试甚至部署代码的工具。能够可靠地将常规工程工作交给 AI 的公司有望降低人员成本并加速产品周期。OSWorld-Verified 基准测试已成为衡量“智能体 (agentic)”能力的准则,因为它要求的不仅仅是静态文本生成,还需要与系统进行真实的现实世界交互。

Qwen3.8-Max 的特性

  • 2.4 万亿参数的 MoE 架构 – 每个 token 最多可调用 64 个专家子网络,阿里巴巴声称这种设计可降低约 40% 的计算成本。
  • 多模态提示词处理 – 该模型可同时接收文本、图像和结构化数据,允许通过单个请求来描述 UI、展示截图并提供配置文件。
  • 64k token 上下文窗口 – 足以容纳完整的代码库、日志文件或长篇技术报告,而无需将其切碎。

这些功能针对的是软件团队耗费大量时间的“端到端”工作流:拉取依赖项、扫描日志、修复漏洞以及生成文档。

数据详解

任务 报告指标
OSWorld-Verified (智能体 OS 交互) 86.1% 成功率
代码生成 (HumanEval-Plus) 78.4% 通过率
多模态推理 (MM-Bench) 84.3%
长上下文摘要 (50k token 测试) 90.2%

所有数据均来自阿里巴巴的内部测试。如果这些数据经得起推敲,该模型将为企业提供单一的 API,在处理代码、图像和大型文档的同时,保持比许多稠密模型 (dense-model) 竞争对手更低的推理成本。

风险与独立验证的必要性

缺乏第三方验证是最直接的疑虑。基准测试可能会被调整,提示词可能会被优化,或者测试集可能会被过滤以有利于特定的架构。在没有外部复现的情况下,关于 Qwen3.8-Max “击败” GPT-5.6 的说法仍是暂定的。此外,MoE 模型可能会表现出性能不均的情况:某些 token 可能会被路由到训练不足的专家,从而导致偶尔的幻觉或输出不一致——当 AI 被期望修改生产系统时,这些问题至关重要。

后续关注点

  • 独立复现 – 研究人员和云客户可能会在公开可用的硬件上运行相同的 OSWorld-Verified 套件和 HumanEval-Plus 测试。
  • 定价与延迟 – 阿里云的 API 定价将揭示 40% 的计算节省是否能转化为开发者的实际成本优势。
  • 安全工具 – 随着自主智能体获得对基础设施更多的控制权,生态系统将需要监控、回滚和审计机制,而这些机制目前仍处于早期阶段。

如果 Qwen3.8-Max 能够兑现其亮眼的数据,那么对话式助手与自给自足的工程机器人之间的差距将大幅缩小。接下来的几个月将展示该模型的性能是否经得起审查,以及企业是否会将其作为自动化开发流水线的核心。