ИсследованияМодели 🇷🇺 19.07.2026 20:03

QuantCode-Bench: новый бенчмарк проверяет, насколько LLM умеют писать работающие алгоритмические торговые стратегии

OpenAIOpenAI AnthropicAnthropic Moonshot AIMoonshot AI Google/DeepMindGoogle/DeepMind xAIxAI DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen
Исследователи представили QuantCode-Bench — бенчмарк для оценки способности больших языковых моделей генерировать исполняемые алгоритмические торговые стратегии по текстовым описаниям. В одношаговом режиме лучшая модель GPT-5.5 достигла 82,5% полного успеха, а с итеративным исправлением — 98,8%. Выяснилось, что синтаксическая корректность кода не гарантирует правильной торговой логики.
QuantCode-Bench — это новый бенчмарк, разработанный для оценки умения больших языковых моделей (LLM) генерировать исполняемые алгоритмические торговые стратегии по текстовым спецификациям. Задача: по англоязычному описанию торговой идеи создать стратегию для фреймворка Backtrader. Оценка проходит в четыре этапа: компиляция (синтаксис), бэктест (исполнение), наличие хотя бы одной сделки и финальная семантическая проверка (Judge Pass). Датасет включает 400 задач из Reddit, TradingView, StackExchange, GitHub и синтетических источников. В одношаговом режиме (single-turn) лучший результат показала GPT-5.5 — 82,5% Judge Pass, за ней идут Claude Opus 4.8 (77,0%) и Claude Opus 4.6 (75,8%). При этом все сильные модели достигают 100% компиляции, но сильно различаются на следующих этапах. В многопопыточном режиме (agentic multi-turn) с обратной связью ошибок результаты резко улучшаются: GPT-5.5 достигает 98,8% Judge Pass, Claude Opus 4.6 — 97,5%. Бенчмарк показывает, что генерация синтаксически корректного кода не гарантирует правильной реализации торговой логики.
Сокращения
LLM = Large Language Model — большая языковая модель
Источник: Habr — хаб NLP — оригинал

Наши прошлые публикации по теме

Есть свежие новости