Onderzoekers van KAIST hebben aangetoond dat het toestaan van een door taalmodellen aangestuurde tradingbot om elke vijf dagen zijn eigen prompt te herschrijven, de Sharpe-ratio verhoogde van 2,94 naar 4,00 en een outperformance van 50 basispunten toevoegde tijdens een proefperiode van 50 dagen. De winst kwam voort uit het dwingen van de bot om elke berekening van tekst naar uitvoerbare Python-code te verplaatsen.
Waarom statische prompts tekortschieten
De meeste LLM-agenten die code uitvoeren, beginnen met een vaste system prompt – een tekstblok dat het model vertelt hoe het zich moet gedragen. De prompt behandelt de code-tool vaak als optionele versiering. Het model kan nog steeds "nadenken" over volatiliteit of verwachte rendementen, maar het schrijft de cijfers in gewone tekst en beslist vervolgens hoeveel het moet investeren op basis van vage gissingen. Het resultaat is een discontinuïteit: het model kan perfect geldige code genereren, maar de uiteindelijke handelsgrootte wordt buiten die code om gekozen, waardoor de beslissing kwetsbaar is voor hallucinaties.
De EvolveTrade-aanpak
Het KAIST-team verving de statische prompt door een meta-agent die de prestaties van de bot beoordeelt op basis van een voortschrijdend venster van vijf dagen. Na elke beoordeling herschrijft de meta-agent de system prompt, waardoor de overeenkomst tussen het taalmodel en de code-interpreter wordt aangescherpt. De nieuwe prompt verplicht drie concrete stappen:
- Maak met Python een tabel met metrieken voor elk actief.
- Pas expliciete wiskundige formules toe om de activa te scoren.
- Leid de gewenste portefeuillegewichten af binnen de code in plaats van in markdown-tekst.
In de praktijk riep de geëvolueerde bot de Python-tool 11 keer per handelscyclus aan – om metrieken te berekenen, risicolimieten te valideren en gewichten te kalibreren – terwijl de baseline-agent de tool slechts één keer aanriep en voor de rest vertrouwde op tekstuele heuristieken.
Cijfers die ertoe doen
Tijdens een 50-daagse backtest op een standaard universum van activa behaalde de geëvolueerde agent:
- Sharpe-ratio: 4,00 vs 2,94 voor de statische agent.
- Cumulatief rendement: 10,56 % vs 8,88 % voor de statische agent.
De outperformance van 50 basispunten komt rechtstreeks voort uit de nauwere koppeling van acties aan deterministische wiskunde. Door de beslissingspipeline van het model volledig observeerbaar en herhaalbaar te maken, hebben de onderzoekers het "gokwerk" geëlimineerd dat doorgaans LLM-gestuurde handelsstrategieën naar beneden haalt.
Wie wint, wie verliest
Voor ontwikkelaars die financiële bots bouwen, is de les duidelijk: als de agent toegang heeft tot een runtime-omgeving, moet de prompt hem dwingen om elk bruikbaar inzicht als code uit te drukken. Het negeren van dit principe zorgt ervoor dat het model de output van tools behandelt als achtergrondruis, wat de prestaties kan aantasten en het risico kan vergroten.
Limieten en tegenargumenten
Waar u op moet letten
Kernpunt: Het toestaan van een LLM om zijn eigen instructieset te herschrijven, dwingt elke handelsbeslissing in verifieerbare code, waardoor een vage tekstgebaseerde agent verandert in een gedisciplineerde motor met een hoger rendement. Ontwikkelaars die het contract tussen prompt en tool negeren, riskeren geld te laten liggen.
