फिनम AI लैब ने एलएलएम के लिए वित्तीय बेंचमार्क FINESSE-Bench को अपडेट किया
Anthropic
Moonshot AI
Google/DeepMind
MiniMax
OpenAI
Meta
DeepSeek
Mistral
Сбер
Яндекс
Т-Банк
फिनम के आर्टिफिशियल इंटेलिजेंस लैबोरेटरी ने वित्तीय बेंचमार्क FINESSE-Bench का अपडेटेड वर्जन जारी किया। नए वर्जन में एक टेक्निकल एनालिसिस डेटासेट CFTe-लाइक लेवल 1 जोड़ा गया है, 169 CFA-लाइक लेवल 1 सवालों को ठीक किया गया है, बूटस्ट्रैपिंग के साथ मीट्रिक कैलकुलेशन में सुधार किया गया है, और तुलनात्मक तालिकाओं में मॉडल पूल को 33 तक बढ़ाया गया है।
Finam आर्टिफिशियल इंटेलिजेंस लैब ने FINESSE-Bench वित्तीय बेंचमार्क का अपडेट जारी किया है, जिसे वित्तीय डोमेन में बड़े भाषा मॉडल (एलएलएम) के ज्ञान और कौशल का मूल्यांकन करने के लिए डिज़ाइन किया गया है। मुख्य बदलावों में शामिल हैं: CFA जैसे लेवल 1 डेटासेट में 169 समस्याग्रस्त प्रश्नों को ठीक करना; टेक्निकल एनालिसिस की मूल बातों पर 781 प्रश्नों के साथ एक नया CFTe जैसा लेवल 1 डेटासेट जोड़ना; अधिक मजबूत मॉडल तुलना के लिए बूटस्ट्रैपिंग के माध्यम से कॉन्फिडेंस इंटरवल गणना में संक्रमण; बेंचमार्क समूहों द्वारा परिणामों को एकत्रित करने के लिए स्तरीकृत बूटस्ट्रैपिंग का उपयोग; डेटासेट की विभेदक शक्ति और संतृप्ति का अलग-अलग मूल्यांकन (यह पाया गया कि अधिकांश FINESSE प्रश्न मध्यवर्ती क्षेत्र में आते हैं, जो अच्छा नैदानिक मूल्य प्रदान करते हैं)। मॉडल पूल का विस्तार किया गया है: कुल 66 सिस्टम का परीक्षण किया गया, जिनमें से 49 का सभी 11 बेंचमार्क (8 FINESSE + 3 सार्वजनिक) पर पूर्ण कवरेज है, और 33 मॉडल मुख्य तालिकाओं में शामिल हैं। शीर्ष परिणाम GPT-5.5 (परीक्षा-जैसे पर 0.906, ट्रेडिंग/टीए पर 0.876), Claude Opus 4.8 (परीक्षा-जैसे पर 0.860, ट्रेडिंग/टीए पर 0.856) और अन्य ने प्राप्त किए।
स्रोत: Habr — хаб NLP —
मूल
