KAIST کے محققین نے دکھایا کہ ایک لینگویج ماڈل پر مبنی ٹریڈنگ بوٹ کو ہر پانچ دن بعد اپنا پرامپٹ (prompt) خود لکھنے کی اجازت دینے سے اس کا Sharpe ratio 2.94 سے بڑھ کر 4.00 ہو گیا اور 50 روزہ آزمائش کے دوران 50 بیسس پوائنٹ کی برتری حاصل ہوئی۔ یہ فائدہ اس وجہ سے ہوا کیونکہ بوٹ کو ہر حساب کتاب کو نثر (prose) سے نکال کر قابلِ عمل Python کوڈ میں تبدیل کرنے پر مجبور کیا گیا۔

جامد پرامپٹس (static prompts) کیوں ناکام رہتے ہیں

زیادہ تر LLM ایجنٹس جو کوڈ چلاتے ہیں، ایک مقررہ سسٹم پرامپٹ سے شروع ہوتے ہیں – متن کا ایک ایسا حصہ جو ماڈل کو بتاتا ہے کہ اسے کیسا برتاؤ کرنا ہے۔ پرامپٹ اکثر کوڈ ٹول کو ایک اختیاری سجاوٹ کے طور پر لیتا ہے۔ ماڈل اب بھی اتار چڑھاؤ (volatility) یا متوقع منافع کے بارے میں "سوچ" سکتا ہے، لیکن وہ نمبروں کو سادہ متن میں لکھتا ہے اور پھر مبہم اندازوں کی بنیاد پر فیصلہ کرتا ہے کہ کتنا سرمایہ کاری کرنی ہے۔ اس کا نتیجہ ایک عدم مطابقت کی صورت میں نکلتا ہے: ماڈل بالکل درست کوڈ تیار کر سکتا ہے، لیکن حتمی ٹریڈ کا سائز اس کوڈ سے باہر منتخب کیا جاتا ہے، جس سے فیصلہ 'ہیلوسینیشن' (hallucination) کا شکار ہو سکتا ہے۔

EvolveTrade کا طریقہ کار

KAIST کی ٹیم نے جامد پرامپٹ کو ایک میٹا ایجنٹ (meta-agent) سے بدل دیا جو پانچ دن کے متحرک وقفے (rolling window) میں بوٹ کی کارکردگی کا جائزہ لیتا ہے۔ ہر جائزے کے بعد، میٹا ایجنٹ سسٹم پرامپٹ کو دوبارہ لکھتا ہے، جس سے لینگویج ماڈل اور اس کے کوڈ انٹرپریٹر کے درمیان تعلق کو مزید مضبوط بنایا جاتا ہے۔ نیا پرامپٹ تین ٹھوس اقدامات کا حکم دیتا ہے:

  • Python کا استعمال کرتے ہوئے ہر اثاثے (asset) کے لیے میٹرکس کا ایک ٹیبل تیار کرنا۔
  • اثاثوں کی درجہ بندی کے لیے واضح ریاضیاتی فارمولے لاگو کرنا۔
  • مارک ڈاؤن متن کے بجائے کوڈ کے اندر ہی ٹارگٹ پورٹ فولیو ویٹس (weights) اخذ کرنا۔

عملی طور پر، ارتقائی بوٹ نے ہر ٹریڈنگ سائیکل میں 11 بار Python ٹول کو کال کیا – میٹرکس کی پیمائش کرنے، رسک کی حدود کی تصدیق کرنے، اور ویٹس کو درست کرنے کے لیے – جبکہ بنیادی ایجنٹ نے صرف ایک بار ٹول کو کال کیا اور باقی کاموں کے لیے ٹیکسٹ پر مبنی ہیورسٹکس (heuristics) پر انحصار کیا۔

اہم اعداد و شمار

اثاثوں کے ایک معیاری مجموعے پر 50 روزہ بیک ٹیسٹ کے دوران، ارتقائی ایجنٹ نے درج ذیل نتائج دکھائے:

  • Sharpe ratio: 4.00 بمقابلہ جامد ایجنٹ کے لیے 2.94۔
  • Cumulative return: 10.56% بمقابلہ جامد ایجنٹ کے لیے 8.88%۔

50 بیسس پوائنٹ کی یہ برتری براہ راست اقدامات کو یقینی ریاضی (deterministic math) کے ساتھ مضبوطی سے جوڑنے سے حاصل ہوئی۔ ماڈل کے فیصلہ سازی کے عمل کو مکمل طور پر قابلِ مشاہدہ اور قابلِ تکرار بنا کر، محققین نے اس "اندازے بازی" کو ختم کر دیا جو عام طور پر LLM پر مبنی ٹریڈنگ حکمت عملیوں کی کارکردگی کو کم کر دیتی ہے۔

کون جیتتا ہے، کون ہارتا ہے

مالیاتی بوٹس بنانے والے ڈویلپرز کے لیے سبق واضح ہے: اگر ایجنٹ کے پاس رن ٹائم انوائرمنٹ (runtime environment) تک رسائی ہے، تو پرامپٹ کو اسے مجبور کرنا چاہیے کہ وہ ہر قابلِ عمل بصیرت کو کوڈ کی صورت میں بیان کرے۔ اس اصول کو نظر انداز کرنے سے ماڈل ٹول کے نتائج کو محض پس منظر کی گپ شپ سمجھ سکتا ہے، جو کارکردگی کو متاثر کر سکتا ہے اور خطرہ بڑھا سکتا ہے۔

حدود اور جوابی نکات

آگے کیا دیکھنا ہے

حاصلِ کلام: ایک LLM کو اپنے ہدایات کے سیٹ کو خود لکھنے کی اجازت دینے سے ہر ٹریڈ کا فیصلہ قابلِ تصدیق کوڈ میں تبدیل ہو جاتا ہے، جو ایک مبہم ٹیکسٹ پر مبنی ایجنٹ کو ایک نظم و ضبط والے، زیادہ منافع بخش انجن میں بدل دیتا ہے۔ وہ ڈویلپرز جو پرامپٹ-ٹول معاہدے کو نظر انداز کرتے ہیں، وہ مالی نقصان اٹھانے کا خطرہ مول لیتے ہیں۔