Finam AI Lab actualiza el benchmark financiero FINESSE-Bench para LLMs
Anthropic
Moonshot AI
Google/DeepMind
MiniMax
OpenAI
Meta
DeepSeek
Mistral
Сбер
Яндекс
Т-Банк
El Laboratorio de Inteligencia Artificial de Finam ha lanzado una versión actualizada del benchmark financiero FINESSE-Bench. La nueva versión agrega un conjunto de datos de análisis técnico CFTe-like Level 1, corrige 169 preguntas CFA-like Level 1, mejora el cálculo de métricas con bootstrapping y expande el grupo de modelos a 33 en tablas comparativas.
El laboratorio de inteligencia artificial de Finam ha publicado una actualización del benchmark financiero FINESSE-Bench, diseñado para evaluar los conocimientos y habilidades de los modelos de lenguaje grandes (LLM, por sus siglas en inglés) en el ámbito financiero. Los cambios principales incluyen: la corrección de 169 preguntas problemáticas en el conjunto de datos de nivel 1 similar al CFA; la incorporación de un nuevo conjunto de datos de nivel 1 similar al CFTe con 781 preguntas sobre los fundamentos del análisis técnico; la transición al cálculo de intervalos de confianza mediante bootstrapping (remuestreo) para una comparación más robusta de modelos; el uso de bootstrapping estratificado para agregar resultados por grupos de benchmarks; la evaluación separada del poder discriminativo y la saturación de los conjuntos de datos (se descubrió que la mayoría de las preguntas de FINESSE se sitúan en la zona intermedia, lo que proporciona un buen valor diagnóstico). El conjunto de modelos se ha ampliado: se probaron un total de 66 sistemas, de los cuales 49 tienen cobertura completa en los 11 benchmarks (8 de FINESSE + 3 públicos), y 33 modelos se incluyen en las tablas principales. Los mejores resultados fueron obtenidos por GPT-5.5 (0.906 en tipo examen, 0.876 en trading/análisis técnico), Claude Opus 4.8 (0.860 en tipo examen, 0.856 en trading/análisis técnico), entre otros.
Fuente: Habr — хаб NLP —
original
