QuantCode-Bench: новый бенчмарк для оценки способности больших языковых моделей генерировать исполняемые алгоритмические торговые стратегии
OpenAI
Anthropic
Google/DeepMind
xAI
DeepSeek
Alibaba/Qwen
Moonshot AI
Исследователи разработали QuantCode-Bench — бенчмарк для оценки того, насколько хорошо большие языковые модели (LLM) могут генерировать исполняемые алгоритмические торговые стратегии на основе текстовых спецификаций. Бенчмарк оценивает не только корректность кода, но и семантическое соответствие исходной торговой идее через четыре этапа: компиляция, бэктестинг, генерация сделок и верификация судьей.
QuantCode-Bench — это бенчмарк, предназначенный для оценки способности больших языковых моделей генерировать исполняемые алгоритмические торговые стратегии на основе описаний на естественном языке. Он содержит 400 задач, собранных с Reddit, TradingView, StackExchange, GitHub, а также синтетических данных, охватывающих три уровня сложности. Пайплайн оценки состоит из четырех этапов: компиляция
Показать ещё ↓
Источник: Habr — хаб NLP —
оригинал
