KAIST के शोधकर्ताओं ने दिखाया कि एक लैंग्वेज-मॉडल-संचालित (language-model-driven) ट्रेडिंग बॉट को हर पांच दिन में अपना प्रॉम्प्ट खुद फिर से लिखने देने से उसका शार्प रेशियो (Sharpe ratio) 2.94 से बढ़कर 4.00 हो गया और 50 दिनों के परीक्षण के दौरान 50-बेसिस-पॉइंट का आउटपरफॉर्मेंस (outperformance) प्राप्त हुआ। यह लाभ बॉट को हर गणना को गद्य (prose) से हटाकर निष्पादन योग्य (executable) Python कोड में बदलने के लिए मजबूर करने से मिला।
स्टैटिक प्रॉम्प्ट्स (static prompts) क्यों कम पड़ जाते हैं
अधिकांश LLM एजेंट्स जो कोड निष्पादित करते हैं, वे एक निश्चित सिस्टम प्रॉम्प्ट (fixed system prompt) के साथ शुरू होते हैं – टेक्स्ट का एक ब्लॉक जो मॉडल को बताता है कि उसे कैसा व्यवहार करना है। प्रॉम्प्ट अक्सर कोड टूल को एक वैकल्पिक सजावट के रूप में मानता है। मॉडल अभी भी अस्थिरता (volatility) या अपेक्षित रिटर्न के बारे में "सोच" सकता है, लेकिन वह संख्याओं को सादे टेक्स्ट में लिखता है और फिर अस्पष्ट अनुमानों के आधार पर यह तय करता है कि कितना निवेश करना है। इसका परिणाम एक विसंगति (disconnect) के रूप में निकलता है: मॉडल पूरी तरह से वैध कोड जेनरेट कर सकता है, फिर भी अंतिम ट्रेड साइज उस कोड के बाहर चुना जाता है, जिससे निर्णय 'hallucination' के प्रति संवेदनशील हो जाता है।
EvolveTrade दृष्टिकोण
KAIST की टीम ने स्टैटिक प्रॉम्प्ट को एक मेटा-एजेंट (meta-agent) से बदल दिया जो पांच दिनों की रोलिंग विंडो पर बॉट के प्रदर्शन की समीक्षा करता है। प्रत्येक समीक्षा के बाद, मेटा-एजेंट सिस्टम प्रॉम्प्ट को फिर से लिखता है, जिससे लैंग्वेज मॉडल और उसके कोड इंटरप्रेटर के बीच का अनुबंध (contract) और मजबूत हो जाता है। नया प्रॉम्प्ट तीन ठोस चरणों को अनिवार्य बनाता है:
- Python का उपयोग करके प्रत्येक एसेट के लिए मेट्रिक्स की एक तालिका बनाएं।
- एसेट्स को स्कोर करने के लिए स्पष्ट गणितीय सूत्रों (mathematical formulas) का उपयोग करें।
- पोर्टफोलियो के लक्षित वेट (target portfolio weights) को मार्कडाउन टेक्स्ट के बजाय कोड के भीतर ही प्राप्त करें।
व्यवहार में, विकसित (evolved) बॉट ने प्रति ट्रेडिंग साइकिल 11 बार Python टूल का उपयोग किया – मेट्रिक्स की गणना करने, जोखिम सीमाओं (risk limits) को मान्य करने और वेट को कैलिब्रेट करने के लिए – जबकि बेसलाइन एजेंट ने केवल एक बार टूल का उपयोग किया और बाकी के लिए टेक्स्टुअल ह्यूरिस्टिक्स (textual heuristics) पर भरोसा किया।
महत्वपूर्ण आंकड़े
एक मानक एसेट यूनिवर्स पर 50-दिवसीय बैक-टेस्ट के दौरान, विकसित एजेंट ने निम्नलिखित परिणाम दिखाए:
- शार्प रेशियो (Sharpe ratio): स्टैटिक एजेंट के 2.94 के मुकाबले 4.00।
- संचयी रिटर्न (Cumulative return): स्टैटिक एजेंट के 8.88% के मुकाबले 10.56%।
50-बेसिस-पॉइंट का यह आउटपरफॉर्मेंस सीधे तौर पर कार्यों को नियतात्मक गणित (deterministic math) के साथ मजबूती से जोड़ने से आता है। मॉडल के निर्णय पाइपलाइन को पूरी तरह से अवलोकन योग्य (observable) और दोहराने योग्य (repeatable) बनाकर, शोधकर्ताओं ने उस "अनुमान लगाने" (guesswork) की प्रक्रिया को समाप्त कर दिया जो आमतौर पर LLM-संचालित ट्रेडिंग रणनीतियों को कमजोर करती है।
कौन जीतता है, कौन हारता है
वित्तीय बॉट बनाने वाले डेवलपर्स के लिए सबक स्पष्ट है: यदि एजेंट के पास रनटाइम एनवायरनमेंट (runtime environment) तक पहुंच है, तो प्रॉम्प्ट को उसे हर कार्रवाई योग्य अंतर्दृष्टि (actionable insight) को कोड के रूप में व्यक्त करने के लिए मजबूर करना चाहिए। इस सिद्धांत की अनदेखी करने से मॉडल टूल के आउटपुट को केवल बैकग्राउंड की बातों (background chatter) की तरह मानने लगता है, जिससे प्रदर्शन कम हो सकता है और जोखिम बढ़ सकता है।
सीमाएं और प्रति-तर्क (Limits and counter-points)
आगे क्या देखें
निष्कर्ष (Takeaway): एक LLM को अपने स्वयं के निर्देश सेट को फिर से लिखने देने से हर ट्रेड निर्णय को सत्यापन योग्य (verifiable) कोड में बदल दिया जाता है, जिससे एक अस्पष्ट टेक्स्ट-आधारित एजेंट एक अनुशासित, उच्च-रिटर्न वाले इंजन में बदल जाता है। जो डेवलपर्स प्रॉम्प्ट-टूल अनुबंध (prompt-tool contract) की अनदेखी करते हैं, वे लाभ कमाने का अवसर खोने का जोखिम उठाते हैं।
