QuantCode-Bench : un nouveau benchmark pour évaluer la capacité des LLMs à générer des stratégies de trading algorithmique exécutables
OpenAI
Anthropic
Google/DeepMind
xAI
DeepSeek
Alibaba/Qwen
Moonshot AI
Des chercheurs ont développé QuantCode-Bench, un benchmark pour évaluer dans quelle mesure les grands modèles de langage (LLMs) peuvent générer des stratégies de trading algorithmique exécutables à partir de spécifications textuelles. Le benchmark évalue non seulement la correction du code, mais aussi l'alignement sémantique avec l'idée de trading originale à travers quatre étapes : compilation, backtest, génération de transactions et vérification par un juge.
QuantCode-Bench est un benchmark conçu pour évaluer la capacité des LLM à générer des stratégies de trading algorithmique exécutables à partir de descriptions en langage naturel. Il contient 400 tâches provenant de Reddit, TradingView, StackExchange, GitHub et de données synthétiques, couvrant trois niveaux de difficulté. Le pipeline d'évaluation comprend quatre étapes : compilation (vérification syntaxique), backtest (exécution en temps réel), trade (au moins une transaction exécutée) et jugement (alignement sémantique via un juge LLM). Deux modes sont supportés : le mode monotour (génération en un seul passage) et le mode multi-tour agentique (jusqu'à 10 itérations avec retour d'information). Les résultats montrent que si presque tous les modèles puissants atteignent une compilation parfaite en mode monotour, les taux de réussite finaux du jugement varient considérablement, avec GPT-5.5 en tête à 82,5%. En mode multi-tour, les performances s'améliorent considérablement, GPT-5.5 atteignant 98,8% de réussite au jugement. Le benchmark souligne que la correction syntaxique est insuffisante pour la génération de code spécifique à un domaine, et que les modèles doivent comprendre le domaine du trading, la sémantique des API et opérationnaliser des descriptions vagues.
Source: Habr — хаб NLP —
original
