QuantCode-Bench:LLMが実行可能なアルゴリズム取引戦略を生成する能力を評価する新しいベンチマーク
OpenAI
Anthropic
Google/DeepMind
xAI
DeepSeek
Alibaba/Qwen
Moonshot AI
研究者らは、大規模言語モデル(LLM)がテキスト仕様から実行可能なアルゴリズム取引戦略をどの程度生成できるかを評価するベンチマーク「QuantCode-Bench」を開発した。このベンチマークは、コードの正確性だけでなく、元の取引アイデアとの意味的整合性も、コンパイル、バックテスト、戦略生成、判定検証の4段階で評価する。
QuantCode-Benchは、自然言語の説明から実行可能なアルゴリズム取引戦略を生成するLLMの能力を評価するために設計されたベンチマークです。Reddit、TradingView、StackExchange、GitHub、および合成データから収集された400のタスクを含み、3つの難易度レベルをカバーしています。評価パイプラインは、コンパイル(構文チェック)、バックテスト(ランタイム実行)、トレード(少なくとも1回の取引実行)、ジャッジ(LLMジャッジによる意味的整合性の確認)の4段階で構成されています。シングルターン(一回生成)とエージェント型マルチターン(フィードバックによる最大10回の反復改良)の2つのモードがサポートされています。結果によると、シングルターンモードではほぼすべての強力なモデルが完全なコンパイルを達成する一方、最終的なジャッジパス率は大きくばらつき、GPT-5.5が82.5%でトップとなりました。マルチターンモードでは性能が劇的に向上し、GPT-5.5は98.8%のジャッジパスを達成しました。このベンチマークは、構文の正しさだけではドメイン固有のコード生成には不十分であり、モデルが取引ドメインやAPIのセマンティクスを理解し、曖昧な記述を具体化する必要があることを強調しています。
出典: Habr — хаб NLP —
原文
