ИсследованияМодели 🇷🇺 27.07.2026 03:03

QuantCode-Bench: новый бенчмарк для оценки способности больших языковых моделей генерировать исполняемые алгоритмические торговые стратегии

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind xAIxAI DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI
Исследователи разработали QuantCode-Bench — бенчмарк для оценки того, насколько хорошо большие языковые модели (LLM) могут генерировать исполняемые алгоритмические торговые стратегии на основе текстовых спецификаций. Бенчмарк оценивает не только корректность кода, но и семантическое соответствие исходной торговой идее через четыре этапа: компиляция, бэктестинг, генерация сделок и верификация судьей.
QuantCode-Bench — это бенчмарк, предназначенный для оценки способности больших языковых моделей генерировать исполняемые алгоритмические торговые стратегии на основе описаний на естественном языке. Он содержит 400 задач, собранных с Reddit, TradingView, StackExchange, GitHub, а также синтетических данных, охватывающих три уровня сложности. Пайплайн оценки состоит из четырех этапов: компиляция
Показать ещё ↓
Источник: Habr — хаб NLP — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости