一个半自主的四智能体流水线可以通过让大语言模型 (LLM) 远离数值计算,仅参与决策判断,从而减少探索性数据分析 (EDA) 中的幻觉。该设计允许模型决定检查什么,而由在沙箱中运行的纯代码执行实际计算,从而提供可以逐步验证的结果。
为什么单次 LLM 调用具有风险
提示 LLM “看看这张电子表格并告诉我哪些内容有趣”会产生一大块文本。模型会编造数字,将推理与输出混在一起,并且不提供得出结论的过程痕迹。当它产生幻觉时——例如编造统计数据或虚假相关性——在错误传达给用户之前,没有任何检查点可以拦截它。
半自主流水线背后的理念
新的工作流将 EDA 分为四个固定阶段,每个阶段由各自的智能体处理。这些智能体遵循“先计划后行动”模式:它们首先决定需要哪种操作,然后将该操作交给实际运行的沙箱代码。LLM 从不执行算术或文件操作;它只对相关性做出判断。
四个智能体
- 数据清洗智能体 – 检查列类型,标记缺失值,并决定填补或类型转换策略。
- 列分析智能体 – 根据每个变量的数据类型和分布,选择合适的视觉化图表(直方图、箱线图等)。
- 关系分析智能体 – 评估每一对列,选择哪些配对值得进行更深入的统计检验,并按潜在洞察力进行排序。
- 报告编写智能体 – 将生成的图表和计算出的统计数据转化为自然语言解释,突出值得注意的模式和注意事项。
每个阶段独立运行,因此列分析和关系分析智能体可以并行执行,从而缩短整体工作流的时间。
如何降低自主性
该流水线的安全规则很简单:模型编写的任何代码都在沙箱中运行,使其与宿主系统隔离。如果执行失败,错误会反馈给模型,模型在流水线中止前最多有两次尝试来修正脚本的机会。这防止了失控循环,并保证模型永远不会直接操作文件或执行算术运算。
由于模型的作用仅限于决定计算什么,实际数字始终来自确定性代码。如果关系分析智能体怀疑“订单 ID”与“月份”之间存在联系,沙箱会运行相关性函数并返回精确值,只有在那之后,模型才会评论这种相关性是因果关系还是巧合。
这解决了什么问题 —— 以及代价是什么
减少幻觉。 通过将推理与计算分离,该流水线消除了编造统计数据最常见的原因:模型猜测数字而不是让代码生成数字。
模块化。 添加新阶段(例如时间序列预测智能体)不需要重写整个提示词。每个智能体都是一个自包含的模块,可以插入到固定的序列中。
速度提升。 与必须串行化每个步骤的单体 LLM 调用相比,独立智能体的并行执行缩短了实际耗时。
复杂度开销。 权衡之处在于更复杂的架构。团队需要维护沙箱环境、处理错误返回循环并编排多个智能体。
后续关注点
- 工具集成。 抽象出沙箱执行步骤的开源框架可以降低工程负担,并使这种模式更容易普及。
- 标准化的智能体契约。 随着更多团队采用多智能体流水线,“先计划后行动”智能体的通用接口可能会出现,从而简化互操作性。
核心教训很明确:给 LLM 思考的自由,而不是计算的权力。通过将其自主权限制在判断层面,并将每个数字通过隔离的代码进行路由,半自主 EDA 流水线产生的结果是可以检查、信任并分享的,无需担心虚假数字。
Source: https://dev.to/sraveend/agentic-but-only-semi-autonomous-designing-an-eda-pipeline-you-can-trust-4ha9
Community discussion: https://t.me/GyaanSetuAi
