QuantCode-Bench:评估大语言模型生成可执行算法交易策略能力的新基准
OpenAI
Anthropic
Google/DeepMind
xAI
DeepSeek
Alibaba/Qwen
Moonshot AI
研究人员开发了QuantCode-Bench基准,用于评估大语言模型(LLMs)根据文本描述生成可执行算法交易策略的能力。该基准不仅评估代码正确性,还通过编译、回测、交易生成和判断验证四个阶段,评估策略与原始交易理念的语义一致性。
QuantCode-Bench是一个基准测试,旨在评估大语言模型根据自然语言描述生成可执行算法交易策略的能力。它包含400个任务,来源涵盖Reddit、TradingView、StackExchange、GitHub以及合成数据,分为三个难度级别。评估流程包含四个阶段:编译(语法检查)、回测(运行时执行)、交易(至少执行一笔交易)和评判(通过大语言模型评判器进行语义对齐)。该基准支持两种模式:单轮(一次性生成)和智能体多轮(最多10轮基于反馈的迭代优化)。结果显示,几乎所有强模型在单轮模式下都能完美通过编译,但最终的评判通过率差异显著,其中GPT-5.5以82.5%的通过率领先。在多轮模式下,性能大幅提升,GPT-5.5的评判通过率达到98.8%。该基准凸显了语法正确性对于特定领域代码生成是不够的,模型必须理解交易领域知识、应用程序接口语义,并能将模糊的描述具体化。
来源: Habr — хаб NLP —
原文
