Penyelidik KAIST menunjukkan bahawa membenarkan bot dagangan dipacu model bahasa menulis semula promnya sendiri setiap lima hari telah meningkatkan nisbah Sharpe daripada 2.94 kepada 4.00 dan menambah prestasi luar biasa sebanyak 50 mata asas (basis-point) sepanjang percubaan 50 hari. Keuntungan tersebut terhasil daripada tindakan memaksa bot tersebut memindahkan setiap pengiraan daripada prosa kepada kod Python yang boleh dilaksanakan.

Mengapa prom statik tidak mencukupi

Kebanyakan ejen LLM yang melaksanakan kod bermula dengan prom sistem yang tetap – satu blok teks yang memberitahu model cara untuk bertindak. Prom tersebut sering menganggap alatan kod sebagai hiasan pilihan sahaja. Model mungkin masih "berfikir" tentang turun naik (volatility) atau jangkaan pulangan, tetapi ia menulis nombor dalam teks biasa dan kemudian memutuskan jumlah pelaburan berdasarkan tekaan yang samar. Hasilnya ialah satu ketidakselarasan: model boleh menjana kod yang sangat sah, namun saiz dagangan akhir dipilih di luar kod tersebut, menyebabkan keputusan tersebut terdedah kepada halusinasi.

Pendekatan EvolveTrade

Pasukan KAIST menggantikan prom statik dengan ejen meta yang menyemak prestasi bot dalam jendela lima hari yang berterusan. Selepas setiap semakan, ejen meta menulis semula prom sistem, memperketat kontrak antara model bahasa dan pentafsir kodnya. Prom baharu tersebut mewajibkan tiga langkah konkrit:

  • Membina jadual metrik untuk setiap aset menggunakan Python.
  • Menggunakan formula matematik yang eksplisit untuk memberi skor kepada aset.
  • Menentukan wajaran portfolio sasaran di dalam kod dan bukannya dalam teks markdown.

Dalam praktiknya, bot yang telah berevolusi itu memanggil alatan Python sebanyak 11 kali bagi setiap kitaran dagangan – untuk mengira metrik, mengesahkan had risiko, dan menentukur wajaran – manakala ejen asas hanya memanggil alatan tersebut sekali, dan bergantung kepada heuristik tekstual untuk selebihnya.

Angka yang penting

Semasa ujian sandar (back-test) selama 50 hari pada alam semesta aset standard, ejen yang telah berevolusi itu mencatatkan:

  • Nisbah Sharpe: 4.00 berbanding 2.94 bagi ejen statik.
  • Pulangan kumulatif: 10.56% berbanding 8.88% bagi ejen statik.

Prestasi luar biasa sebanyak 50 mata asas tersebut berpunca secara langsung daripada pengikatan tindakan yang lebih ketat kepada matematik deterministik. Dengan menjadikan saluran keputusan model boleh diperhati sepenuhnya dan boleh diulang, penyelidik telah menghapuskan "kerja tekaan" yang biasanya menjejaskan strategi dagangan dipacu LLM.

Siapa yang menang, siapa yang kalah

Bagi pembangun yang membina bot kewangan, pengajarannya jelas: jika ejen mempunyai akses kepada persekitaran masa larian (runtime environment), prom mesti memaksanya untuk menyatakan setiap cerapan yang boleh diambil tindakan sebagai kod. Mengabaikan prinsip ini membolehkan model menganggap output alatan sebagai sembang latar belakang, yang boleh menghakis prestasi dan meningkatkan risiko.

Had dan hujah balas

Apa yang perlu diperhatikan seterusnya

Rumusan: Membenarkan LLM menulis semula set arahan sendiri memaksa setiap keputusan dagangan ke dalam kod yang boleh disahkan, mengubah ejen berasaskan teks yang kabur kepada enjin yang berdisiplin dengan pulangan yang lebih tinggi. Pembangun yang mengabaikan kontrak prom-alatan berisiko kerugian peluang keuntungan.