阿里巴巴发布 Qwen3.8-Flash-Next:高效 AI 的新时代
阿里巴巴 Qwen 团队正式发布了 Qwen3.8-Flash-Next,这是一款突破性的多模态混合专家 (MoE) 模型,旨在以极低的传统成本提供顶尖性能。作为即将发布的 Qwen4 的架构预览,该模型通过优化参数的激活和存储方式,挑战了更大规模 LLM 的主导地位。
革命性架构:N-gram 嵌入创新
Qwen3.8-Flash-Next 最突出的技术成就之一在于其对规模与效率之间关系的独特处理。虽然该模型拥有 1250 亿个总参数,但它采用了稀疏 MoE 方法,每个 token 仅激活 60 亿个参数。这使得它能够在不牺牲稠密模型知识广度的前提下,实现高速推理。
计划在完整的 Qwen4 版本中推出的关键创新是引入了一个拥有 510 亿参数的 N-gram 嵌入层。该层充当“短语词典”的功能,将常见的词组作为独立条目存储。至关重要的是,该层被设计为驻留在常规系统 RAM 中,而非昂贵的 GPU 显存中,从而显著降低了运行模型所需的硬件开销。此外,该模型原生支持高达 262,144 个 token 的超大上下文窗口,并可以通过 YaRN 技术扩展至一百万个 token。
在编程与生产力方面超越巨头
尽管激活参数量较小,但 Qwen3.8-Flash-Next 的基准测试结果经常超越规模大得多的竞争对手,如 DeepSeek-V4-Flash(2840 亿参数)和 Anthropic 的 Claude Opus 4.6 (Max)。该模型在“智能体 (agentic)”任务中表现尤为出色——即 AI 必须独立在复杂的软件环境中进行操作以解决问题的场景。
在专业基准测试中,Flash-Next 在 SWE-bench Pro 上获得了 62.5 分,在 DeepSWE 上获得了 58.7 分,表现优于 DeepSeek 和 Claude。在专业工作流中,这种性能差距更为显著;在 CoWorkBench 上,Flash-Next 得分为 73.9,几乎是 DeepSeek-V4-Flash (45.1) 的两倍。在 JobBench 上,它获得了 55.7 分,相比之前的 Qwen3.7-Plus 模型记录的 27.6 分有了巨大的飞跃。
颠覆性的定价与竞争格局
阿里巴巴不仅在智能水平上进行竞争,还在追求极致的成本效益。通过 QwenCloud 提供服务的生产版本 Qwen3.8-Flash,其定价令人震惊:每百万输入 token 仅需 0.16 美元,每百万输出 token 仅需 0.47 美元。从对比的角度来看,该模型的表现几乎与旗舰级 Qwen3.8-Max 持平,但成本仅为其约十二分之一。
这种激进的定价策略给 OpenAI 和 Anthropic 等西方 AI 巨头带来了巨大压力。通过证明一个训练成本仅为前代模型九分之一的模型,也能在编程和办公任务中提供更优的结果,阿里巴巴正在向行业发出信号:AI 的未来可能不属于规模最大的模型,而属于架构效率最高的模型。
核心要点
- 架构预览: Qwen3.8-Flash-Next 引入了 51B N-gram 嵌入层,利用系统 RAM 来降低对 GPU 的依赖,这是 Qwen4 架构的前奏。
- 基准测试优势: 该模型在智能体编程 (SWE-bench Pro) 和专业生产力 (CoWorkBench) 方面超越了 Claude Opus 4.6 和 DeepSeek-V4-Flash 等规模更大的对手。
- 极致的成本效益: 每个 token 的激活参数量仅为 6B,该模型以旗舰模型极低的价格提供了高阶智能,颠覆了当前的 AI 定价格局。
