Forscher der KAIST zeigten, dass ein sprachmodellgesteuerter Trading-Bot, der seinen eigenen Prompt alle fünf Tage neu schreibt, seine Sharpe-Ratio von 2,94 auf 4,00 steigerte und in einem 50-tägigen Testlauf eine Outperformance von 50 Basispunkten erzielte. Der Gewinn resultierte daraus, dass der Bot gezwungen wurde, jede Berechnung von Fließtext in ausführbaren Python-Code zu überführen.

Warum statische Prompts zu kurz greifen

Die meisten LLM-Agenten, die Code ausführen, beginnen mit einem festen System-Prompt – einem Textblock, der dem Modell sein Verhalten vorgibt. Der Prompt behandelt das Code-Tool oft nur als optionales Beiwerk. Das Modell mag zwar weiterhin über Volatilität oder erwartete Renditen „nachdenken“, schreibt die Zahlen jedoch in reinem Text und entscheidet dann auf Basis vager Vermutungen, wie viel investiert werden soll. Das Ergebnis ist eine Diskrepanz: Das Modell kann zwar perfekt gültigen Code generieren, doch die endgültige Handelsgröße wird außerhalb dieses Codes festgelegt, was die Entscheidung anfällig für Halluzinationen macht.

Der EvolveTrade-Ansatz

Das KAIST-Team ersetzte den statischen Prompt durch einen Meta-Agenten, der die Performance des Bots in einem rollierenden Fünf-Tage-Fenster überprüft. Nach jeder Überprüfung schreibt der Meta-Agent den System-Prompt neu und verschärft so den „Vertrag“ zwischen dem Sprachmodell und seinem Code-Interpreter. Der neue Prompt schreibt drei konkrete Schritte vor:

  • Erstellung einer Metriken-Tabelle für jedes Asset mittels Python.
  • Anwendung expliziter mathematischer Formeln zur Bewertung der Assets.
  • Ableitung der Zielgewichtung des Portfolios innerhalb des Codes anstatt in Markdown-Text.

In der Praxis rief der optimierte Bot das Python-Tool 11 Mal pro Handelszyklus auf – um Metriken zu berechnen, Risikolimits zu validieren und Gewichtungen zu kalibrieren –, während der Basis-Agent das Tool nur einmal aufrief und für den Rest auf textbasierte Heuristiken vertraute.

Zahlen, die zählen

Während eines 50-tägigen Backtests auf ein Standard-Asset-Universum erzielte der optimierte Agent:

  • Sharpe-Ratio: 4,00 gegenüber 2,94 beim statischen Agenten.
  • Kumulierte Rendite: 10,56 % gegenüber 8,88 % beim statischen Agenten.

Die Outperformance von 50 Basispunkten resultiert direkt aus der engeren Bindung von Aktionen an deterministische Mathematik. Indem die Forscher die Entscheidungspipeline des Modells vollständig beobachtbar und reproduzierbar machten, eliminierten sie das „Raten“, das LLM-gesteuerte Handelsstrategien typischerweise ausbremst.

Gewinner und Verlierer

Für Entwickler, die Finanz-Bots bauen, ist die Lehre klar: Wenn der Agent Zugriff auf eine Laufzeitumgebung hat, muss der Prompt ihn dazu zwingen, jede handlungsrelevante Erkenntnis als Code auszudrücken. Wer dieses Prinzip ignoriert, lässt das Modell die Tool-Ausgaben wie Hintergrundrauschen behandeln, was die Performance beeinträchtigen und das Risiko erhöhen kann.

Grenzen und Gegenargumente

Worauf man als Nächstes achten sollte

Fazit: Ein LLM sein eigenes Instruktionsset neu schreiben zu lassen, zwingt jede Handelsentscheidung in verifizierbaren Code und verwandelt einen vagen, textbasierten Agenten in eine disziplinierte Engine mit höheren Renditen. Entwickler, die den Prompt-Tool-Vertrag ignorieren, riskieren, Geld liegen zu lassen.