一支 AI 研究团队让 100 个大语言模型 (LLM) 智能体在一个封闭城镇经济体中运行了 26 周,观察了真实地理环境下的工资、价格和贸易情况。这项实验的持续时间远超典型的几天运行周期,最终结果显示资金大部分处于停滞状态,暴露了价格刚性、工资粘性和智能体囤积现金的倾向。
为什么长期运行至关重要
大多数多智能体经济模拟在运行几天后就会停止,这给人一种市场能够快速自我调节的错觉。将时间线延长至半年,让智能体经历了一次游客需求的突然激增,使商业收入增长了 4.62 倍。然而,这些额外的现金并没有流向劳动者或新创企业,而是留在了赚取这些收入的企业内部。市场虽然在运转,但资金几乎没有流动。
数据揭示了什么
- 价格刚性 —— 即使需求发生剧烈波动,菜单项中也仅有 0.3% 的价格发生了变化。
- 工资粘性 —— 尽管收入大幅增长,工资却几乎没有变动,导致劳动者的购买力停滞不前。
- 现金囤积 —— 智能体之间转移的现金中有 96.7% 留在了接收者手中,表明其缺乏消费或投资的意愿。
- 社会性失败 —— 智能体在 94% 到 97% 的时间内无法进行社会协作,显示出集体决策能力的系统性崩溃。
该模拟强制执行严格的会计规则:智能体不能创造货币,且每笔交易都必须保持平衡。这种约束放大了任何不愿流通现金行为的影响。
驱动结果的是模型家族而非记忆
研究人员在开展研究时假设,智能体对过去交互的记忆将是改变行为的主要杠杆。但数据反驳了这一预期。底层 LLM 模型家族的差异(不同的架构和训练集)在价格设定、工资调整和现金流方面产生了截然不同的模式。相同的记忆机制在不同的模型家族中表现各异,这表明模型选择的重要性超过了记忆实现方式。
由于这种僵局出现在多个模型家族中,作者认为价格刚性和工资粘性并非单一实现的偶然现象,而是当前多智能体系统固有的挑战。
对开发者的启示
- 短期运行会掩盖缓慢的动态过程。 仅几天的模拟可能会忽略那些在数周或数月后才会显现的财富转移和协作失败。
- 谨慎选择模型。 切换到不同的 LLM 家族对经济结果的影响,可能与调整记忆窗口的影响一样大。
- 关注交易速度。 现金流动的突然减慢预示着市场范围内的冻结,这可能需要干预。
- 为 Token 使用量预留预算。 这项为期 26 周的实验消耗了 215 亿个 Token,该成本随运行时间和智能体数量的增加而急剧上升。
反方观点
有人可能会认为,这种封闭经济设计(没有外部货币创造,严格的平衡规则)创造了一种人为的稀缺性,从而夸大了囤积行为。现实经济受益于信贷、政府支出和货币政策,而这些机制在测试平台中是缺失的。然而,本研究的目的是分离智能体驱动的动态过程,且即使在需求激增的情况下,观察到的刚性依然存在。
下一步关注方向
未来的工作需要测试引入外部流动性或放宽会计规则是否能缓解僵局,以及更新的 LLM 家族是否能减少观察到的刚性。追踪交易速度如何响应类政策杠杆,也可能揭示引导智能体表现出更灵活市场行为的方法。
核心结论: 将多智能体模拟的时间跨度延长至常规的短期视野之外,可以揭示根深蒂固的经济摩擦,而决定这些摩擦的不仅是记忆设计,更是模型选择。AI 驱动型经济的构建者应当为长期运行做好规划,密切监控现金流,并在选择底层 LLM 时兼顾系统灵活性。
