KAIST 的研究人员表明,让一个由语言模型驱动的交易机器人每五天重写一次自己的提示词(prompt),使其夏普比率(Sharpe ratio)从 2.94 提升至 4.00,并在为期 50 天的测试中实现了 50 个基点的超额收益。这一增长源于强制机器人将所有计算从自然语言文本转变为可执行的 Python 代码。
为什么静态提示词表现不佳
大多数执行代码的 LLM 智能体(agent)都始于一个固定的系统提示词——一段告诉模型如何行为的文本块。提示词通常将代码工具视为可选的装饰。模型可能仍在“思考”波动率或预期回报,但它会将数字写成纯文本,然后根据模糊的猜测来决定投资多少。结果导致了脱节:模型可以生成完全有效的代码,但最终的交易规模却是在代码之外选定的,使得决策容易受到幻觉的影响。
EvolveTrade 方法
KAIST 团队用一个元智能体(meta-agent)取代了静态提示词,该元智能体会在滚动的五天窗口期内审查机器人的表现。每次审查后,元智能体都会重写系统提示词,从而强化语言模型与其代码解释器(code interpreter)之间的契约。新的提示词强制执行三个具体步骤:
- 使用 Python 为每个资产构建指标表。
- 应用明确的数学公式为资产评分。
- 在代码内部推导目标投资组合权重,而不是在 Markdown 文本中进行。
在实践中,进化后的机器人每个交易周期会调用 11 次 Python 工具——用于计算指标、验证风险限制和校准权重——而基准智能体仅调用一次工具,其余部分则依赖文本启发式方法。
关键数据
在针对标准资产池进行的 50 天回测期间,进化后的智能体表现如下:
- 夏普比率: 4.00,而静态智能体为 2.94。
- 累计收益率: 10.56%,而静态智能体为 8.88%。
这 50 个基点的超额收益直接源于将操作与确定性数学更紧密地绑定在一起。通过使模型的决策流程完全可观测且可重复,研究人员消除了通常会拖累 LLM 驱动交易策略的“猜测”环节。
谁赢谁输
对于构建金融机器人的开发者来说,教训是显而易见的:如果智能体可以访问运行时环境,提示词必须强制它将每一个可执行的洞察转化为代码。忽视这一原则会导致模型将工具输出视为背景杂音,从而削弱性能并增加风险。
局限性与反论点
后续关注点
核心启示: 让 LLM 重写自己的指令集,可以将每一次交易决策强制转化为可验证的代码,从而将一个模糊的基于文本的智能体转变为一个纪律严明、高回报的引擎。忽视“提示词-工具”契约的开发者可能会错失获利机会。
