Finam AI Lab met à jour le benchmark financier FINESSE-Bench pour les LLM
Anthropic
Moonshot AI
Google/DeepMind
MiniMax
OpenAI
Meta
DeepSeek
Mistral
Сбер
Яндекс
Т-Банк
Le laboratoire d'intelligence artificielle de Finam a publié une version mise à jour du benchmark financier FINESSE-Bench. La nouvelle version ajoute un ensemble de données d'analyse technique CFTe-like Level 1, corrige 169 questions CFA-like Level 1, améliore le calcul des métriques avec bootstrap et étend le pool de modèles à 33 dans les tableaux comparatifs.
Le Finam Artificial Intelligence Lab a publié une mise à jour du benchmark financier FINESSE-Bench, conçu pour évaluer les connaissances et les compétences des grands modèles de langage (LLM) dans le domaine financier. Les principales modifications incluent : la correction de 169 questions problématiques dans l'ensemble de données de niveau 1 de type CFA ; l'ajout d'un nouvel ensemble de données de niveau 1 de type CFTe avec 781 questions sur les fondamentaux de l'analyse technique ; le passage au calcul des intervalles de confiance par bootstrap pour une comparaison plus robuste des modèles ; l'utilisation du bootstrap stratifié pour agréger les résultats par groupes de benchmarks ; l'évaluation séparée du pouvoir discriminant et de la saturation des ensembles de données (il a été constaté que la plupart des questions de FINESSE se situent dans la zone intermédiaire, offrant une bonne valeur diagnostique). Le pool de modèles a été élargi : au total, 66 systèmes ont été testés, dont 49 couvrent l'intégralité des 11 benchmarks (8 FINESSE + 3 publics), et 33 modèles sont inclus dans les tableaux principaux. Les meilleurs résultats ont été obtenus par GPT-5.5 (0,906 sur les questions de type examen, 0,876 sur le trading et l'analyse technique), Claude Opus 4.8 (0,860 sur les questions de type examen, 0,856 sur le trading et l'analyse technique), et d'autres.
Source: Habr — хаб NLP —
original
