你打开了上周二使用的同一个聊天窗口,AI 接着你上次中断的地方继续。它引用了你之前的指令,模仿你讽刺的语气,并询问你是否完成了那份报告。有那么一瞬间,感觉就像在和一个真正留心工作的同事协作。然而,当你开始一段全新的对话时,一切都消失了。语气变得平淡,项目细节不翼而飞,它甚至叫错了你的名字。发生了什么?
机器并没有忘记你。它从一开始就从未认识过你。
记忆错觉
我们天生倾向于在任何地方寻找记忆。当聊天机器人记得你偏好简短的列举要点,或者记得你在医疗保健行业工作时,它触发了与酒保记得你的常点酒水时相同的本能。但这是一种设计上的技巧,而非认知。大语言模型并不会将关于你的事实存储在它们的权重(weights)中。它们没有关于你交互过程的运行日志。它们无法窥视名为“用户偏好”的文件夹,因为根本不存在这样的文件夹。
看似记忆的东西,实际上只是存在于上下文窗口(context window)中的文本。模型读取最近的聊天历史、你当前的提示词(prompt)以及开发者附加的任何系统指令。它在一次扫视中处理所有这些信息,预测下一个词,然后做出响应。当这些文本消失时,“记忆”也随之消失。模型会重置回其基准行为——通常是自信、通用且略显过于热情的。错觉的破灭是因为上下文发生了变化,而不是因为 AI 患上了健忘症。
AI 实际使用的内容
如果你想要可靠的输出,你需要了解信息实际来源的四个地方:
- 聊天历史: 当前对话线程中最近的往返交流。这是暂时的。一旦开启新线程,它就会消失。
- 提示词中的具体指令: 你现在输入或粘贴到对话框中的任何内容。这是最直接的控制形式。
- 来自知识库的文档: 系统可以搜索并注入到提示词中的文件或数据库。这需要一个检索(retrieval)步骤,而该步骤可能会在无声无息中失败。
- 从工作流中获取的数据: 由第三方应用附加的 API 调用、数据库查询或记忆功能。它们的质量取决于连接它们的代码。
这些都不是有机记忆。它们只是底层的“管道”。如果管道脱落或错误的文件被吸入了提示词,AI 不会向你发出警告。它只会直接使用它看到的内容,并产生一个看起来专业、可信但完全错误的答案。
当上下文断裂时:一个真实的案例
想象一个营销团队要求 AI 起草客户邮件。周一,Sarah 开始了一场对话,并粘贴了一份简短的风格指南:“使用冷静、克制的语言。避免使用感叹号。落款仅使用公司名称。”AI 完美地遵循了指南,团队非常喜欢这些草稿。
周三,Jake 打开了一个全新的对话。他输入道:“起草客户跟进邮件。”他没有粘贴风格指南。AI 在没有看到相反指令的情况下,默认使用了高能量的营销文案。感叹号满天飞,它甚至建议“让我们大干一场吧!”团队发出了哀叹。“为什么 AI 忘记了?”他们问道。
它并没有忘记。它根本没有什么可以忘记的。Jake 未能在新的上下文窗口中包含风格指南,而模型无法得知团队在两天前的另一场对话中已经确立了规则。挫败感是真实的,但原因在于人,而非机器。团队期望的是持久的记忆,而该工具提供的仅仅是一个临时的草稿本。
真正的测试:审计机器所看到的内容
提高结果最快的方法是停止询问“AI 记得这个吗?”,转而开始询问“它现在实际接收到了什么上下文?”通过以下三个问题来审视你的设置:
AI 每次都需要知道什么? 这是你不可逾越的上下文。品牌语调、安全策略、输出格式、合规性约束。如果这些信息至关重要,它应该存在于一个会被注入到每个相关提示词中的参考文档中,而不是存在于三周前的某个聊天线程里。
哪些内容可以存储以备后续检索? 历史项目笔记、产品规格或过去的研究可以存储在结构化文件或数据库中。但仅仅存储是不够的。你需要确切地知道系统是如何决定将存储中的哪一部分提取到对话中的。如果检索依赖于关键词匹配,那么你在提示词中稍微改变一下措辞,就可能抓取到错误的页面。
人类必须进行哪些手动检查?
当错误成本很高时——例如财务数据、医疗摘要、法律术语、面向客户的公告——不要盲目信任流水线。人类需要验证 AI 是否使用了正确版本的文档,以及输出内容在现实世界中是否合理。模型不会告诉你它刚刚引用了去年的价格表。除非你在提示词(prompt)中注明,否则它并不知道现在是哪一年。
构建“上下文优先”的工作流
可靠的 AI 工作很大程度上取决于良好的信息架构。以下是构建方法。
将你的稳定规则放在一份参考文档中。这是你的“单一事实来源”(single source of truth)。当规则发生变化时,只需编辑这一个文件。不要将指令分散在数十个聊天线程中。
仅将该文档的相关部分传递给当前任务。将一本百页的手册直接丢进提示词中既昂贵又充满噪音。只需检索与该特定问题相关的两页内容即可。精准度胜过容量。
将短期细节保留在当前提示词中。如果你正在为一篇关于电动自行车的博客文章构思标题,请在提示词中提到“电动自行车”。不要假设模型知道你在想什么,仅仅因为你昨天提到过它。
当错误代价高昂时,使用人工来审查输出。AI 永远不会感到尴尬。它发送错误的账单或语调不当的道歉时,会表现出与其他任务一样的自信。必须有人来进行“合理性检查”(sanity check)。
分层思考
将 AI 信息想象成四个堆叠的层级,每一层都有其自身的可靠性和风险,这会有所帮助。
即时上下文(Immediate context)是当前的提示词。这 100% 受你控制,前提是你愿意花心思去写。模糊的提示词只会得到模糊的结果。
存储上下文(Stored context)是你保存在某处的信息:Notion 维基、向量数据库或 PDF 文件夹。它确实存在,但除非有东西搭建起桥梁,否则 AI 看不到它。
检索上下文(Retrieved context)是通过搜索逻辑、代码或插件从存储中提取到提示词中的数据。这是大多数“静默失败”发生的地方。系统可能会抓取旧合同而不是修订后的合同,或者抓取截图而不是电子表格。
人类上下文(Human context)是你对什么是真实的、什么是重要的以及什么是异常的个人判断。这是唯一能够判断答案是否过时、来源是否可靠或语调是否契合当下情境的层级。不要将这一层外包出去。
那些获得最佳效果的团队并不是在使用更聪明的模型。他们正在构建上下文可见、有版本控制且易于验证的系统。他们深知,一个拥有完美上下文的 AI,每一次的表现都会优于一个基于错误信息工作的天才模型。
所以,不要再把这些工具当成需要训斥的健忘实习生了。要把它们当成透镜。它们只会向你展示你放在它们面前的东西。养成在责怪景象之前先检查镜片的习惯。
加入 GyaanSetu AI 学习社区:https://t.me/GyaanSetuAi
