超越 Transformer:重新定义大语言模型(LLM)下一时代的初创公司
Transformer 时代正面临根本性的瓶颈,因为大语言模型(LLM)的计算需求已达到临界点。虽然 2017 年的论文《Attention Is All You Need》为当前的 AI 热潮奠定了基础,但新一代初创公司正竞相替换或重构核心架构,以实现真正的效率。
Transformer 的瓶颈:为什么稠密注意力机制正在失效
近十年来,Transformer 一直是 AI 产业的引擎,其核心是被称为“稠密注意力”(dense attention)的机制。该过程通过大规模乘法,将文本块中的每一个 token 与其他所有 token 进行比较。虽然这种方式在捕捉语义含义方面极其准确,但其数学复杂度的扩展性较差。
例如,一篇 10,000 字的文档可能需要 Transformer 进行大约 5000 万次乘法运算。这种计算量的平方级增长带来了两个巨大的挑战:飙升的能源消耗和有限的上下文窗口。据报道,OpenAI 今年计划在计算方面投入 500 亿美元,而数据中心的电力需求预计到 2030 年将翻倍,行业正面临成本和物理定律的双重壁垒。
重新思考注意力机制:稀疏机制的兴起
为了解决效率危机,一些初创公司正尝试从稠密注意力转向“稀疏注意力”(sparse attention)。稀疏注意力不再计算所有可能的单词配对,而是仅关注最相关的连接,从而显著减轻计算负载。
总部位于迈阿密的初创公司 Subquadratic 是该领域的领导者,其拥有 SubQ 模型。以往的稀疏机制在维持准确性方面表现不佳,而 Subquadratic 声称其技术在编程和搜索等专业任务中可以媲美主流 LLM。他们的方法涉及一个动态系统,能够实时识别哪些单词对给定文本真正重要,而不是在无关的 token 上浪费计算周期。
效能保留:迈向滚动摘要
另一种方法是完全摆脱注意力机制。总部位于旧金山的 Manifest AI 正在开创一种称为“功率保留”(power retention)的技术。虽然像 SubQ 这样的稀疏注意力模型仍试图保留整个上下文窗口的大致轮廓,但“功率保留”通过为模型提供其记忆的滚动摘要来工作。
随着新信息进入上下文窗口,模型会识别并丢弃相关性较低的数据,从而确保无论输入规模如何,计算负载都能保持在可控范围内。Manifest AI 已经通过以下方式证明了这种方法的可行性:
- 使用功率保留技术将开源的 StarCoder 模型转换为 PowerCoder。
- 发布了 Brumby 模型,他们声称该模型可以媲美阿里巴巴广受欢迎的 Qwen 开源模型。
能够以极少的重新训练将现有的 Transformer 模型适配为功率保留模型,这表明向“LLMs+”(下一代模型)的过渡可能会比预期快得多。
核心要点
- Transformer 的极限: 稠密注意力的平方级扩展使得当前的 LLM 运行成本极高,且难以针对海量数据集或长文本推理进行扩展。
- 稀疏 vs. 保留: 初创公司正从两个方向解决问题:Subquadratic 通过稀疏计算优化注意力(SubQ),而 Manifest AI 则通过滚动摘要来取代注意力机制(Power Retention)。
- 经济必然性: 随着 AI 计算成本达到数百亿美元,下一代 AI 时代的赢家很可能是那些解决效率问题,而不仅仅是追求规模的人。
