研究モデル 🇷🇺 27.07.2026 04:05

Finam AI Lab、LLM向け金融ベンチマークFINESSE-Benchを更新

AnthropicAnthropic Moonshot AIMoonshot AI Google/DeepMindGoogle/DeepMind MiniMaxMiniMax OpenAIOpenAI MetaMeta DeepSeekDeepSeek MistralMistral СберСбер ЯндексЯндекс Т-БанкТ-Банк
Finamの人工知能研究所は、金融ベンチマークFINESSE-Benchの更新版をリリースしました。新バージョンでは、テクニカル分析データセットCFTe-like Level 1を追加し、CFA-like Level 1の質問169問を修正し、ブートストラップ法によるメトリクス計算を改善し、比較表のモデルプールを33に拡大しています。
Finam Artificial Intelligence Lab は、金融分野における大規模言語モデル(LLM)の知識とスキルを評価するためのベンチマークである FINESSE-Bench のアップデートをリリースしました。主な変更点は次のとおりです。CFA 相当のレベル 1 データセット内の問題点 169 問を修正。テクニカル分析の基礎に関する 781 問からなる新しい CFTe 相当のレベル 1 データセットを追加。よりロバストなモデル比較のため、ブートストラップ法による信頼区間計算に移行。ベンチマークグループごとの結果集計に層化ブートストラップ法を採用。データセットの識別力と飽和度を個別に評価(ほとんどの FINESSE 問題は中間ゾーンに位置し、良好な診断価値を提供することが判明)。モデルプールを拡充。合計 66 のシステムをテストし、そのうち 49 が全 11 ベンチマーク(FINESSE 8 つ + 公開 3 つ)をカバーしており、33 モデルがメインテーブルに含まれています。上位結果は GPT-5.5(試験系で 0.906、トレーディング/テクニカル分析で 0.876)、Claude Opus 4.8(試験系で 0.860、トレーディング/テクニカル分析で 0.856)などが達成しました。
出典: Habr — хаб NLP — 原文
関連記事 ↓
新着ニュース