Các nhà nghiên cứu tại KAIST đã chỉ ra rằng việc cho phép một bot giao dịch vận hành bằng mô hình ngôn ngữ tự viết lại prompt của chính nó sau mỗi năm ngày đã giúp nâng tỷ số Sharpe từ 2,94 lên 4,00 và mang lại mức hiệu suất vượt trội thêm 50 điểm cơ bản (basis points) trong một thử nghiệm kéo dài 50 ngày. Sự gia tăng này đến từ việc buộc bot phải chuyển mọi tính toán từ dạng văn bản thuần túy sang mã Python có thể thực thi được.
Tại sao các prompt tĩnh lại không hiệu quả
Hầu hết các agent LLM thực thi mã đều bắt đầu với một system prompt cố định – một khối văn bản hướng dẫn mô hình cách hành xử. Prompt này thường coi công cụ lập trình chỉ là một phần bổ trợ tùy chọn. Mô hình có thể vẫn "suy nghĩ" về biến động hoặc lợi nhuận kỳ vọng, nhưng nó lại viết các con số dưới dạng văn bản thuần túy và sau đó quyết định mức đầu tư dựa trên những phỏng đoán mơ hồ. Kết quả là sự mất kết nối: mô hình có thể tạo ra mã hoàn toàn hợp lệ, nhưng quy mô giao dịch cuối cùng lại được chọn bên ngoài đoạn mã đó, khiến quyết định dễ bị ảnh hưởng bởi hiện tượng ảo giác (hallucination).
Phương pháp EvolveTrade
Nhóm nghiên cứu KAIST đã thay thế prompt tĩnh bằng một meta-agent để đánh giá hiệu suất của bot theo chu kỳ 5 ngày liên tục. Sau mỗi lần đánh giá, meta-agent sẽ viết lại system prompt, thắt chặt "hợp đồng" giữa mô hình ngôn ngữ và trình thông dịch mã của nó. Prompt mới bắt buộc thực hiện ba bước cụ thể:
- Xây dựng bảng các chỉ số cho mọi tài sản bằng Python.
- Áp dụng các công thức toán học rõ ràng để chấm điểm các tài sản.
- Tính toán tỷ trọng danh mục mục tiêu ngay trong mã thay vì trong văn bản markdown.
Trong thực tế, bot đã được cải tiến gọi công cụ Python 11 lần trong mỗi chu kỳ giao dịch – để tính toán các chỉ số, xác thực các giới hạn rủi ro và hiệu chỉnh tỷ trọng – trong khi agent cơ sở chỉ gọi công cụ một lần và dựa vào các quy tắc kinh nghiệm (heuristics) bằng văn bản cho các phần còn lại.
Những con số quan trọng
Trong một đợt back-test kéo dài 50 ngày trên một tập hợp tài sản tiêu chuẩn, agent được cải tiến đã đạt được:
- Tỷ số Sharpe: 4,00 so với 2,94 của agent tĩnh.
- Lợi nhuận tích lũy: 10,56% so với 8,88% của agent tĩnh.
Mức hiệu suất vượt trội 50 điểm cơ bản bắt nguồn trực tiếp từ việc gắn kết chặt chẽ hơn giữa các hành động với toán học xác định. Bằng cách làm cho quy trình ra quyết định của mô hình có thể quan sát và lặp lại hoàn toàn, các nhà nghiên cứu đã loại bỏ sự "đoán mò" vốn thường kéo thấp hiệu quả của các chiến lược giao dịch do LLM điều khiển.
Ai thắng, ai thua
Đối với các nhà phát triển đang xây dựng bot tài chính, bài học rất rõ ràng: nếu agent có quyền truy cập vào môi trường thực thi (runtime environment), prompt phải buộc nó thể hiện mọi thông tin chuyên sâu có thể hành động được dưới dạng mã. Việc bỏ qua nguyên tắc này sẽ khiến mô hình coi đầu ra của công cụ như những thông tin nền không quan trọng, điều này có thể làm xói mòn hiệu suất và tăng rủi ro.
Các giới hạn và quan điểm phản biện
Những điều cần theo dõi tiếp theo
Bài học rút ra: Việc cho phép một LLM tự viết lại bộ hướng dẫn của chính nó sẽ buộc mọi quyết định giao dịch phải nằm trong mã có thể kiểm chứng, biến một agent dựa trên văn bản mơ hồ thành một bộ máy kỷ luật với lợi nhuận cao hơn. Những nhà phát triển phớt lờ "hợp đồng" giữa prompt và công cụ sẽ có nguy cơ đánh mất lợi nhuận tiềm năng.
