I ricercatori del KAIST hanno dimostrato che permettere a un bot di trading guidato da un modello linguistico di riscrivere il proprio prompt ogni cinque giorni ha elevato il suo Sharpe ratio da 2,94 a 4,00, aggiungendo una sovraperformance di 50 punti base in un periodo di prova di 50 giorni. Il guadagno è derivato dall'aver costretto il bot a spostare ogni calcolo dalla prosa al codice Python eseguibile.
Perché i prompt statici sono insufficienti
La maggior parte degli agenti LLM che eseguono codice parte da un system prompt fisso: un blocco di testo che indica al modello come comportarsi. Spesso il prompt tratta lo strumento di codice come una decorazione opzionale. Il modello può ancora "pensare" alla volatilità o ai rendimenti attesi, ma scrive i numeri in testo semplice e poi decide quanto investire sulla base di congetture vaghe. Il risultato è una disconnessione: il modello può generare codice perfettamente valido, eppure la dimensione finale dell'operazione viene scelta al di fuori di quel codice, lasciando la decisione vulnerabile alle allucinazioni.
L'approccio EvolveTrade
Il team del KAIST ha sostituito il prompt statico con un meta-agente che revisiona le prestazioni del bot su una finestra mobile di cinque giorni. Dopo ogni revisione, il meta-agente riscrive il system prompt, stringendo il contratto tra il modello linguistico e il suo interprete di codice. Il nuovo prompt impone tre passaggi concreti:
- Creare una tabella di metriche per ogni asset utilizzando Python.
- Applicare formule matematiche esplicite per valutare gli asset.
- Derivare i pesi target del portafoglio all'interno del codice anziché nel testo markdown.
In pratica, il bot evoluto ha chiamato lo strumento Python 11 volte per ciclo di trading – per calcolare le metriche, convalidare i limiti di rischio e calibrare i pesi – mentre l'agente di base ha chiamato lo strumento solo una volta, affidandosi a euristiche testuali per il resto.
I numeri che contano
Durante un back-test di 50 giorni su un universo di asset standard, l'agente evoluto ha registrato:
- Sharpe ratio: 4,00 rispetto a 2,94 dell'agente statico.
- Rendimento cumulativo: 10,56% rispetto all'8,88% dell'agente statico.
La sovraperformance di 50 punti base deriva direttamente dal legame più stretto tra le azioni e la matematica deterministica. Rendendo il processo decisionale del modello completamente osservabile e ripetibile, i ricercatori hanno eliminato le "congetture" che tipicamente penalizzano le strategie di trading guidate da LLM.
Chi vince e chi perde
Per gli sviluppatori che costruiscono bot finanziari, la lezione è chiara: se l'agente ha accesso a un ambiente di runtime, il prompt deve costringerlo a esprimere ogni intuizione azionabile sotto forma di codice. Ignorare questo principio permette al modello di trattare gli output degli strumenti come rumore di fondo, il che può erodere le prestazioni e aumentare il rischio.
Limiti e controargomentazioni
Cosa osservare in seguito
Takeaway: Permettere a un LLM di riscrivere il proprio set di istruzioni costringe ogni decisione di trading in un codice verificabile, trasformando un agente testuale vago in un motore disciplinato ad alto rendimento. Gli sviluppatori che ignorano il contratto prompt-strumento rischiano di lasciare soldi sul tavolo.
