นักวิจัยจาก KAIST แสดงให้เห็นว่าการปล่อยให้บอทเทรดที่ขับเคลื่อนด้วยโมเดลภาษา (language-model-driven trading bot) เขียน prompt ของตัวเองใหม่ทุกๆ 5 วัน ช่วยเพิ่ม Sharpe ratio จาก 2.94 เป็น 4.00 และสร้างผลตอบแทนที่เหนือกว่า (outperformance) ถึง 50 basis points ในช่วงการทดสอบ 50 วัน ผลกำไรที่เพิ่มขึ้นนี้มาจากการบังคับให้บอทเปลี่ยนการคำนวณทุกอย่างจากข้อความบรรยาย (prose) ให้กลายเป็นโค้ด Python ที่สามารถรันได้จริง

ทำไม prompt แบบคงที่ (static prompts) ถึงยังไม่ดีพอ

LLM agent ส่วนใหญ่ที่รันโค้ดมักจะเริ่มต้นด้วย system prompt แบบคงที่ ซึ่งเป็นข้อความชุดหนึ่งที่บอกโมเดลว่าควรมีพฤติกรรมอย่างไร บ่อยครั้งที่ prompt เหล่านี้มองว่าเครื่องมือเขียนโค้ดเป็นเพียงส่วนประกอบเสริม โมเดลอาจจะยัง "คิด" เกี่ยวกับความผันผวน (volatility) หรือผลตอบแทนที่คาดหวัง (expected returns) แต่กลับเขียนตัวเลขออกมาเป็นข้อความธรรมดา แล้วจึงตัดสินใจว่าจะลงทุนเท่าไหร่โดยใช้การคาดเดาที่คลุมเครือ ผลลัพธ์ที่ได้คือความไม่สอดคล้องกัน: แม้โมเดลจะสามารถสร้างโค้ดที่ถูกต้องสมบูรณ์ได้ แต่ขนาดการเทรดสุดท้ายกลับถูกเลือกนอกเหนือจากโค้ดนั้น ทำให้การตัดสินใจมีความเสี่ยงต่อการเกิดอาการหลอน (hallucination)

แนวทางแบบ EvolveTrade

ทีม KAIST ได้เปลี่ยนจาก prompt แบบคงที่มาเป็น meta-agent ที่คอยตรวจสอบประสิทธิภาพของบอทแบบต่อเนื่องทุกๆ 5 วัน หลังจากตรวจสอบแต่ละครั้ง meta-agent จะเขียน system prompt ใหม่ เพื่อกระชับข้อกำหนด (contract) ระหว่างโมเดลภาษากับตัวแปลโค้ด (code interpreter) ให้แน่นแฟ้นยิ่งขึ้น โดย prompt ใหม่จะกำหนดขั้นตอนที่ชัดเจน 3 ประการ:

  • สร้างตารางตัวชี้วัด (metrics) สำหรับสินทรัพย์ทุกตัวโดยใช้ Python
  • ใช้สูตรทางคณิตศาสตร์ที่ชัดเจนในการให้คะแนนสินทรัพย์
  • คำนวณน้ำหนักพอร์ตโฟลิโอเป้าหมาย (target portfolio weights) ภายในโค้ด แทนที่จะเขียนในรูปแบบข้อความ markdown

ในทางปฏิบัติ บอทที่ผ่านการพัฒนา (evolved bot) เรียกใช้เครื่องมือ Python ถึง 11 ครั้งต่อหนึ่งรอบการเทรด เพื่อคำนวณตัวชี้วัด, ตรวจสอบขีดจำกัดความเสี่ยง (risk limits) และปรับน้ำหนัก (calibrate weights) ในขณะที่เอเจนต์ที่เป็นตัวเปรียบเทียบ (baseline agent) เรียกใช้เครื่องมือเพียงครั้งเดียว และใช้วิธีการตัดสินใจจากข้อความ (textual heuristics) ในส่วนที่เหลือ

ตัวเลขที่สำคัญ

ในระหว่างการทำ back-test เป็นเวลา 50 วันกับกลุ่มสินทรัพย์มาตรฐาน (standard asset universe) เอเจนต์ที่ผ่านการพัฒนาทำผลงานได้ดังนี้:

  • Sharpe ratio: 4.00 เทียบกับ 2.94 สำหรับเอเจนต์แบบคงที่
  • Cumulative return: 10.56% เทียบกับ 8.88% สำหรับเอเจนต์แบบคงที่

ผลตอบแทนที่เหนือกว่า 50 basis points นี้มาจากความเชื่อมโยงที่แน่นแฟ้นยิ่งขึ้นระหว่างการกระทำและคณิตศาสตร์ที่แน่นอน (deterministic math) การทำให้กระบวนการตัดสินใจของโมเดลสามารถสังเกตได้และทำซ้ำได้ทั้งหมด ช่วยให้นักวิจัยสามารถกำจัด "การคาดเดา" ซึ่งมักจะเป็นตัวฉุดรั้งกลยุทธ์การเทรดที่ขับเคลื่อนด้วย LLM

ใครได้ประโยชน์ ใครเสียประโยชน์

สำหรับนักพัฒนาที่สร้างบอททางการเงิน บทเรียนนี้ชัดเจนมาก: หากเอเจนต์สามารถเข้าถึงสภาพแวดล้อมการรันไทม์ (runtime environment) ได้ prompt จะต้องบังคับให้เอเจนต์แสดงข้อมูลเชิงลึกที่นำไปใช้งานได้ (actionable insight) ทุกอย่างในรูปแบบของโค้ด การละเลยหลักการนี้จะทำให้โมเดลมองว่าผลลัพธ์จากเครื่องมือเป็นเพียงข้อมูลประกอบทั่วไป ซึ่งอาจบั่นทอนประสิทธิภาพและเพิ่มความเสี่ยงได้

ข้อจำกัดและข้อโต้แย้ง

สิ่งที่ต้องจับตามองต่อไป

บทสรุป: การปล่อยให้ LLM เขียนชุดคำสั่งของตัวเองใหม่ จะเป็นการบังคับให้ทุกการตัดสินใจในการเทรดอยู่ในรูปแบบโค้ดที่ตรวจสอบได้ เปลี่ยนจากเอเจนต์ที่ใช้ข้อความแบบคลุมเครือ ให้กลายเป็นเครื่องยนต์ที่สร้างผลตอบแทนสูงและมีวินัย นักพัฒนาที่ละเลยข้อตกลงระหว่าง prompt และเครื่องมือ (prompt-tool contract) มีความเสี่ยงที่จะเสียโอกาสในการทำกำไร