Laboratório de IA da Finam atualiza benchmark financeiro FINESSE-Bench para LLMs
Anthropic
Moonshot AI
Google/DeepMind
MiniMax
OpenAI
Meta
DeepSeek
Mistral
Сбер
Яндекс
Т-Банк
O Laboratório de Inteligência Artificial da Finam lançou uma versão atualizada do benchmark financeiro FINESSE-Bench. A nova versão adiciona um conjunto de dados de análise técnica CFTe-like Nível 1, corrige 169 questões do tipo CFA Nível 1, melhora o cálculo de métricas com bootstrap e expande o conjunto de modelos para 33 nas tabelas comparativas.
O Finam Artificial Intelligence Lab lançou uma atualização do benchmark financeiro FINESSE-Bench, projetado para avaliar o conhecimento e as habilidades de grandes modelos de linguagem (LLMs) no domínio financeiro. As principais mudanças incluem: correção de 169 questões problemáticas no conjunto de dados Nível 1 semelhante ao CFA; adição de um novo conjunto de dados Nível 1 semelhante ao CFTe com 781 questões sobre fundamentos da análise técnica; transição para o cálculo de intervalo de confiança via bootstrapping para comparação mais robusta de modelos; uso de bootstrapping estratificado para agregar resultados por grupos de benchmark; avaliação separada do poder discriminativo e da saturação do conjunto de dados (constatou-se que a maioria das questões do FINESSE se enquadra na zona intermediária, proporcionando bom valor diagnóstico). O conjunto de modelos foi expandido: um total de 66 sistemas foram testados, dos quais 49 têm cobertura total em todos os 11 benchmarks (8 FINESSE + 3 públicos), e 33 modelos estão incluídos nas tabelas principais. Os melhores resultados foram alcançados pelo GPT-5.5 (0,906 em exam-like, 0,876 em trading/TA), Claude Opus 4.8 (0,860 em exam-like, 0,856 em trading/TA) e outros.
Fonte: Habr — хаб NLP —
original
