PesquisaModelos 🇷🇺 27.07.2026 03:03

QuantCode-Bench: um novo benchmark para avaliar a capacidade de LLMs em gerar estratégias de negociação algorítmica executáveis

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind xAIxAI DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI
Pesquisadores desenvolveram o QuantCode-Bench, um benchmark para avaliar quão bem grandes modelos de linguagem (LLMs) conseguem gerar estratégias de negociação algorítmica executáveis a partir de especificações textuais. O benchmark avalia não apenas a correção do código, mas também o alinhamento semântico com a ideia de negociação original por meio de quatro estágios: compilação, backtest, geração de negociação e verificação por juiz.
O QuantCode-Bench é um benchmark projetado para avaliar a capacidade de LLMs de gerar estratégias de trading algorítmico executáveis a partir de descrições em linguagem natural. Ele contém 400 tarefas originadas do Reddit, TradingView, StackExchange, GitHub e dados sintéticos, abrangendo três níveis de dificuldade. O pipeline de avaliação consiste em quatro estágios: Compilação (verificação sintática), Backtest (execução em tempo real), Trade (pelo menos uma negociação executada) e Judge (alinhamento semântico através de um juiz LLM). Dois modos são suportados: single-turn (geração única) e agentic multi-turn (até 10 refinamentos iterativos com feedback). Os resultados mostram que, embora quase todos os modelos fortes atinjam compilação perfeita no modo single-turn, as taxas finais de aprovação no Judge variam amplamente, com o GPT-5.5 liderando com 82,5%. No modo multi-turn, o desempenho melhora drasticamente, com o GPT-5.5 alcançando 98,8% de aprovação no Judge. O benchmark destaca que a correção sintática é insuficiente para a geração de código específica de domínio, e que os modelos devem entender o domínio de trading, a semântica da API e operacionalizar descrições vagas.
Fonte: Habr — хаб NLP — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas