QuantCode-Bench: un nuevo benchmark para evaluar la capacidad de los LLMs de generar estrategias de trading algorítmico ejecutables
OpenAI
Anthropic
Google/DeepMind
xAI
DeepSeek
Alibaba/Qwen
Moonshot AI
Investigadores desarrollaron QuantCode-Bench, un benchmark para evaluar qué tan bien los modelos de lenguaje de gran escala (LLMs) pueden generar estrategias de trading algorítmico ejecutables a partir de especificaciones textuales. El benchmark evalúa no solo la corrección del código, sino también la alineación semántica con la idea de trading original a través de cuatro etapas: compilación, backtest, generación de trades y verificación por juez.
QuantCode-Bench es un benchmark diseñado para evaluar la capacidad de los LLM de generar estrategias de trading algorítmico ejecutables a partir de descripciones en lenguaje natural. Contiene 400 tareas obtenidas de Reddit, TradingView, StackExchange, GitHub y datos sintéticos, cubriendo tres niveles de dificultad. El pipeline de evaluación consta de cuatro etapas: Compilación (verificación sintáctica), Backtest (ejecución en tiempo real), Trade (al menos una operación ejecutada) y Judge (alineación semántica mediante un juez LLM). Se admiten dos modos: monovuelta (generación única) y multivueltas agéntico (hasta 10 refinamientos iterativos con retroalimentación). Los resultados muestran que, aunque casi todos los modelos fuertes logran una compilación perfecta en modo monovuelta, las tasas de aprobación final del Judge varían ampliamente, liderando GPT-5.5 con un 82,5 %. En modo multivueltas, el rendimiento mejora drásticamente, alcanzando GPT-5.5 un 98,8 % de aprobación del Judge. El benchmark destaca que la corrección sintáctica es insuficiente para la generación de código en un dominio específico, y que los modelos deben comprender el dominio del trading, la semántica de la API y operacionalizar descripciones vagas.
Fuente: Habr — хаб NLP —
original
