QuantCode-Bench: een nieuwe benchmark om het vermogen van LLM's om uitvoerbare algoritmische handelsstrategieën te genereren te evalueren
OpenAI
Anthropic
Google/DeepMind
xAI
DeepSeek
Alibaba/Qwen
Moonshot AI
Onderzoekers hebben QuantCode-Bench ontwikkeld, een benchmark om te beoordelen hoe goed grote taalmodellen (LLM's) uitvoerbare algoritmische handelsstrategieën kunnen genereren op basis van tekstuele specificaties. De benchmark evalueert niet alleen de juistheid van de code, maar ook de semantische overeenstemming met het oorspronkelijke handelsidee door middel van vier fasen: compilatie, backtest, trade-generatie en rechterverificatie.
QuantCode-Bench is een benchmark die is ontworpen om het vermogen van LLM's te evalueren om uitvoerbare algoritmische handelsstrategieën te genereren op basis van beschrijvingen in natuurlijke taal. Het bevat 400 taken afkomstig van Reddit, TradingView, StackExchange, GitHub en synthetische data, verdeeld over drie moeilijkheidsniveaus. De evaluatiepijplijn bestaat uit vier fasen: Compilatie (syntactische controle), Backtest (runtime-uitvoering), Trade (minstens één transactie uitgevoerd) en Judge (semantische afstemming via een LLM-beoordelaar). Twee modi worden ondersteund: single-turn (eenmalige generatie) en agentic multi-turn (maximaal 10 iteratieve verbeteringen met feedback). De resultaten laten zien dat, hoewel bijna alle sterke modellen in single-turn-modus perfecte compilatie bereiken, de uiteindelijke Judge Pass-percentages sterk variëren, met GPT-5.5 dat leidt met 82,5%. In multi-turn-modus verbetert de prestatie aanzienlijk, waarbij GPT-5.5 een Judge Pass van 98,8% bereikt. De benchmark benadrukt dat syntactische correctheid onvoldoende is voor domeinspecifieke codegeneratie en dat modellen het handelsdomein, de API-semantiek moeten begrijpen en vage beschrijvingen operationeel moeten kunnen maken.
Bron: Habr — хаб NLP —
origineel
