智能体检索(Agentic retrieval)被视为传统检索增强生成(RAG)流水线之后的下一步,它有望打造出不再产生幻觉、并开始“思考”如何获取信息的生产级 AI 系统。支持者表示,与将整个语料库输入模型的上下文窗口相比,该方法在处理大型文档集查询时的成本可降低高达 82 倍,对于任何正在扩展生成式 AI 规模的企业来说,这种成本节约都至关重要。

为什么传统的 RAG 流水线存在不足

经典的 RAG 工作流是一个固定的序列:将文档拆分为块(chunks),将每个块嵌入到稠密向量空间中,然后为用户查询提取得分最高的向量。在演示中,这种方法看起来很整洁——模型接收到少量“相关”段落并自信地回答。然而,在生产环境中,这种自信往往是错位的。

三个系统性缺陷导致了这一问题:

  • 向量相似度 $\neq$ 相关性。 两段文字在数学上可能非常接近,但表达的事实却截然相反,导致模型引用错误的说法。
  • 碎片化破坏事实。 固定分块经常会将单一陈述切断。如果模型只接收到其中一半,它就无法重建缺失的部分。
  • 查询混乱。 现实世界的问题往往偏离了大多数嵌入模型的训练数据,因此相似度搜索会返回无关的块。

当流水线返回错误的上下文时,下游语言模型仍然会生成答案,且通常表现出很高的确定性,而系统并不会报错。其结果就是“沉默的幻觉”——一种在实时服务中难以检测到的无声失败。

混合检索:一种渐进式的修复方案

一种常见的应对方案是在稠密向量之上叠加关键词搜索,从而创建一个混合检索器,可以捕捉到嵌入模型可能遗漏的精确术语匹配。添加重排序模型(Reranker)——即根据学习到的相关性得分对检索列表进行重新排序的第二个模型——可以进一步提高精度。

混合检索仍然遵循静态脚本:无论难度或不确定性如何,每个查询都会触发相同的步骤序列。流水线无法决定是否需要更多数据、如何将复杂问题分解为子问题,或者检索到的片段是否不足。

智能体检索将搜索视为决策过程

智能体检索将问题重新定义为由模仿人类研究员的自主“智能体”(agent)做出的一系列决策。该智能体可以:

  • 重写查询。 在搜索之前,它会对口语化或模糊的措辞进行规范化,从而提高检索模型理解意图的概率。
  • 询问是否需要检索。 对于简单直接的查询,智能体直接回答,从而节省 Token 并避免不必要的噪声。
  • 规划多步搜索。 将复杂问题分解为较小的子问题,每个子问题独立进行搜索,然后重新组合。
  • 自我修正。 如果初始结果看起来很弱(例如置信度得分较低或证据矛盾),智能体会使用不同的表述重新发布查询,或扩大搜索范围。

成本争论:长上下文 vs. 检索

一些评论人士认为,不断扩大的上下文窗口会让检索变得过时。反驳观点则非常务实:将海量语料库输入模型的上下文,其成本比针对性的检索要高出几个数量级。据估计,对于大型数据集,检索的成本要低 8 到 82 倍,同时仍能提供准确回答所需的上下文支撑。长上下文窗口对于在少量、精选的文档集上进行细致推理仍然有用,但它们无法取代可扩展的搜索。

透明度与验证

生产级的 AI 助手必须展示其来源。智能体检索可以为每个说法附加引用,允许人工审核员验证事实核查路径。这种“展示过程”的方法可以建立信任,并暴露弱检索路径,以便智能体在未来的交互中学习规避。

后续关注点

  • 工具链。
  • 评估标准。
  • 企业试点。

总结

智能体检索超越了在许多演示中占据主导地位的、静态且易错的 RAG 流水线。通过让 AI 系统决定何时以及如何进行搜索,它减少了 Token 使用量,大幅降低了成本,并且——至关重要的一点是——为每个答案提供了可验证的来源。