QuantCode-Bench: ein neuer Benchmark zur Bewertung der Fähigkeit von LLMs, ausführbare algorithmische Handelsstrategien zu generieren
OpenAI
Anthropic
Google/DeepMind
xAI
DeepSeek
Alibaba/Qwen
Moonshot AI
Forscher haben QuantCode-Bench entwickelt, einen Benchmark, der bewertet, wie gut große Sprachmodelle (Large Language Models, LLMs) aus textuellen Spezifikationen ausführbare algorithmische Handelsstrategien generieren können. Der Benchmark bewertet nicht nur die Code-Korrektheit, sondern auch die semantische Übereinstimmung mit der ursprünglichen Handelsidee in vier Phasen: Kompilierung, Backtesting, Handelsgenerierung und Prüfverifikation.
QuantCode-Bench ist ein Benchmark zur Bewertung der Fähigkeit großer Sprachmodelle (Large Language Models, LLMs), aus natürlichsprachlichen Beschreibungen ausführbare algorithmische Handelsstrategien zu generieren. Es enthält 400 Aufgaben aus Reddit, TradingView, StackExchange, GitHub sowie synthetischen Daten, die drei Schwierigkeitsgrade abdecken. Die Auswertungspipeline besteht aus vier Stufen: Kompilierung (syntaktische Prüfung), Backtest (Laufzeitausführung), Trade (mindestens eine ausgeführte Transaktion) und Judge (semantische Übereinstimmung mittels eines LLM-Richters). Unterstützt werden zwei Modi: ein Single-Turn-Modus (einmalige Generierung) und ein agentischer Multi-Turn-Modus (bis zu zehn iterative Verfeinerungen mit Feedback). Die Ergebnisse zeigen, dass nahezu alle leistungsstarken Modelle im Single-Turn-Modus eine perfekte Kompilierung erreichen, die endgültige Judge-Pass-Rate jedoch stark variiert, wobei GPT-5.5 mit 82,5 % führt. Im Multi-Turn-Modus verbessert sich die Leistung drastisch, GPT-5.5 erreicht eine Judge-Pass-Rate von 98,8 %. Der Benchmark zeigt, dass syntaktische Korrektheit für domänenspezifische Codegenerierung nicht ausreicht und Modelle die Handelsdomäne, API-Semantik sowie die Operationalisierung vager Beschreibungen verstehen müssen.
Quelle: Habr — хаб NLP —
Original
