QuantCode-Bench: chuẩn đánh giá mới cho khả năng tạo chiến lược giao dịch thuật toán có thể thực thi của các mô hình ngôn ngữ lớn
OpenAI
Anthropic
Google/DeepMind
xAI
DeepSeek
Alibaba/Qwen
Moonshot AI
Các nhà nghiên cứu phát triển QuantCode-Bench, một chuẩn đánh giá khả năng của các mô hình ngôn ngữ lớn (LLM) trong việc tạo ra các chiến lược giao dịch thuật toán có thể thực thi dựa trên mô tả văn bản. Chuẩn này không chỉ đánh giá tính chính xác của mã nguồn mà còn cả sự phù hợp về mặt ngữ nghĩa với ý tưởng giao dịch ban đầu thông qua bốn giai đoạn: biên dịch, kiểm tra lại, tạo lệnh giao dịch và xác minh đánh giá.
QuantCode-Bench là một chuẩn đánh giá được thiết kế để đo lường khả năng của các LLM trong việc tạo ra các chiến lược giao dịch thuật toán có thể thực thi từ các mô tả ngôn ngữ tự nhiên. Nó bao gồm 400 tác vụ lấy từ Reddit, TradingView, StackExchange, GitHub và dữ liệu tổng hợp, trải dài ba mức độ khó. Quy trình đánh giá gồm bốn giai đoạn: Compilation (kiểm tra cú pháp), Backtest (thực thi runtime), Trade (ít nhất một giao dịch được thực hiện) và Judge (đánh giá mức độ phù hợp ngữ nghĩa thông qua một LLM judge). Hai chế độ được hỗ trợ: single-turn (sinh một lần) và agentic multi-turn (tối đa 10 lần tinh chỉnh lặp có phản hồi). Kết quả cho thấy mặc dù hầu hết các mô hình mạnh đều đạt điểm compilation hoàn hảo ở chế độ single-turn, tỷ lệ Judge Pass cuối cùng lại rất khác nhau, với GPT-5.5 dẫn đầu ở mức 82.5%. Ở chế độ multi-turn, hiệu suất cải thiện đáng kể, với GPT-5.5 đạt 98.8% Judge Pass. Chuẩn này nhấn mạnh rằng tính đúng cú pháp là chưa đủ cho việc sinh mã chuyên biệt cho lĩnh vực, và các mô hình phải hiểu được lĩnh vực giao dịch, ngữ nghĩa API và vận hành hóa các mô tả mơ hồ.
Nguồn: Habr — хаб NLP —
bản gốc
