阿里巴巴发布 Qwen3.8-Max:面向 AI Agent 的 2.4 万亿参数巨兽

阿里巴巴 Qwen 团队宣布推出 Qwen3.8-Max,这是一款拥有 2.4 万亿参数的海量旗舰模型,旨在超越简单的聊天提示,迈向长程自主推理(long-horizon autonomous reasoning)。通过专注于多日工作流和复杂任务执行,该模型标志着从响应式 LLM 向主动式 AI Agent 的重大转变。

通过扩展参数实现自主智能

Qwen3.8-Max 是一个技术强力引擎,总计使用 2.4 万亿参数,每次查询时激活参数为 950 亿。该模型基于 Qwen3.5 架构构建,专门针对“长程”(long-horizon)任务进行了优化——即需要 AI 在数天甚至数周内独立运行的复杂目标。

对于开源社区而言,这是一个重大举措:阿里巴巴已确认将于下周公开 Qwen-Max 系列模型的权重,这将挑战 GPT 和 Claude 等前沿模型闭源统治的局面。

通过编程与研究证明自主性

为了展示其 Agent 能力,阿里巴巴展示了几个在高风险场景下的案例研究,在这些研究中,模型在无需人工干预的情况下运行:

  • 软件工程: 在为期 16 天的时间里,Qwen3.8-Max 自主开发了命令行工具 oh-my-cli。它能够自行管理 GitHub issues、编写代码、运行测试,并执行了 265 次 commits 和 127 次 pull requests。
  • 科学复现: 在承担复现《Unified Data Selection for LLM Reasoning》论文结果的任务时,该模型花费了 125 小时的计算时间编写了 7,600 行代码。它不仅复现了原始研究,还将 AIME24 数学基准测试分数提高了 2.7 分。
  • 竞技数据科学: 在 WWW2025 多模态对话意图识别挑战赛中,该模型的表现超越了 526 支人类团队中的 458 支,在 24 小时内将其准确率从 0.60 提升到了 0.853。

超越软件:芯片设计与财务模拟

Qwen3.8-Max 的推理能力已延伸至硬件和经济领域。在一次加密电路设计任务中,该模型通过迭代将一个“臃肿”的设计从 8,298 个逻辑门减少到了仅 678 个。通过使用 OpenROAD 工具,这使得芯片的物理面积减少了 81%。

在名为 E-Commerce-Bench 的复杂零售模拟中,该模型在模拟的财年中管理着多家在线商店。从 10 万元人民币起步,它完成了供应商谈判,识别出 152 名诈骗者,并应对了供应链中断,最终资产达到 416,252 元——初始资金翻了四倍多,并显著超越了亚军 GLM 5.2。

多模态前沿与基准测试统治力

该模型还推向了多模态处理的边界,能够处理 200 页的文档和超过 100 小时的视频。阿里巴巴还推出了 RecreationBench,这是一个测试 Agent 能力的基准测试,旨在测试其仅通过视觉和键盘交互(无需访问源代码)来重建正在运行的应用程序(在 Windows、macOS、Android 等平台上)的能力。

根据内部基准测试,Qwen3.8-Max 可直接与顶尖模型竞争,在多个类别中表现接近或超过 Claude Opus 4.8 和 GPT-5.6 Sol,其中在 PaperBench 上的得分达到了领先的 93 分。

核心要点

  • 海量规模: Qwen3.8-Max 拥有 2.4 万亿总参数和 950 亿激活参数,针对多日自主工作流进行了优化。
  • 卓越的 Agent 能力: 该模型已展示出能够自主处理复杂软件工程、芯片设计优化以及全规模财务管理的能力。
  • 开源权重的冲击力: 与许多前沿模型不同,阿里巴巴计划发布 Qwen-Max 系列的权重,为开发者提供前所未有的获取高阶 Agent 智能的机会。