Finam AI实验室更新金融基准FINESSE-Bench用于大语言模型
Anthropic
Moonshot AI
Google/DeepMind
MiniMax
OpenAI
Meta
DeepSeek
Mistral
Сбер
Яндекс
Т-Банк
Finam人工智能实验室发布了金融基准FINESSE-Bench的更新版本。新版本新增了CFTe-like Level 1技术分析数据集,修复了169道CFA-like Level 1题目,采用自助法改进指标计算,并将对比表中的模型池扩大至33个。
Finam人工智能实验室发布了FINESSE-Bench金融基准测试的更新,该基准测试旨在评估大语言模型在金融领域的知识与技能。主要变化包括:在类似CFA的一级数据集中修复了169个有问题的题目;新增了包含781道技术分析基础题目的类似CFTe一级数据集;采用自助法进行置信区间计算,以实现更稳健的模型比较;通过分层自助法按基准组汇总结果;分别评估数据集的区分能力和饱和程度(发现大多数FINESSE题目处于中等难度区间,具有良好的诊断价值)。模型池已扩大:共测试了66个系统,其中49个系统在所有11个基准测试(8个FINESSE + 3个公开)中实现了全覆盖,主表中包含33个模型。在考试类任务中,GPT-5.5取得了最佳成绩(0.906),在交易/技术分析类任务中为0.876;Claude Opus 4.8在考试类任务中得分为0.860,在交易/技术分析类任务中为0.856;其他模型也表现突出。
来源: Habr — хаб NLP —
原文
