शोधमॉडल 🇷🇺 27.07.2026 04:05

फिनम AI लैब ने एलएलएम के लिए वित्तीय बेंचमार्क FINESSE-Bench को अपडेट किया

AnthropicAnthropic Moonshot AIMoonshot AI Google/DeepMindGoogle/DeepMind MiniMaxMiniMax OpenAIOpenAI MetaMeta DeepSeekDeepSeek MistralMistral СберСбер ЯндексЯндекс Т-БанкТ-Банк
फिनम के आर्टिफिशियल इंटेलिजेंस लैबोरेटरी ने वित्तीय बेंचमार्क FINESSE-Bench का अपडेटेड वर्जन जारी किया। नए वर्जन में एक टेक्निकल एनालिसिस डेटासेट CFTe-लाइक लेवल 1 जोड़ा गया है, 169 CFA-लाइक लेवल 1 सवालों को ठीक किया गया है, बूटस्ट्रैपिंग के साथ मीट्रिक कैलकुलेशन में सुधार किया गया है, और तुलनात्मक तालिकाओं में मॉडल पूल को 33 तक बढ़ाया गया है।
Finam आर्टिफिशियल इंटेलिजेंस लैब ने FINESSE-Bench वित्तीय बेंचमार्क का अपडेट जारी किया है, जिसे वित्तीय डोमेन में बड़े भाषा मॉडल (एलएलएम) के ज्ञान और कौशल का मूल्यांकन करने के लिए डिज़ाइन किया गया है। मुख्य बदलावों में शामिल हैं: CFA जैसे लेवल 1 डेटासेट में 169 समस्याग्रस्त प्रश्नों को ठीक करना; टेक्निकल एनालिसिस की मूल बातों पर 781 प्रश्नों के साथ एक नया CFTe जैसा लेवल 1 डेटासेट जोड़ना; अधिक मजबूत मॉडल तुलना के लिए बूटस्ट्रैपिंग के माध्यम से कॉन्फिडेंस इंटरवल गणना में संक्रमण; बेंचमार्क समूहों द्वारा परिणामों को एकत्रित करने के लिए स्तरीकृत बूटस्ट्रैपिंग का उपयोग; डेटासेट की विभेदक शक्ति और संतृप्ति का अलग-अलग मूल्यांकन (यह पाया गया कि अधिकांश FINESSE प्रश्न मध्यवर्ती क्षेत्र में आते हैं, जो अच्छा नैदानिक मूल्य प्रदान करते हैं)। मॉडल पूल का विस्तार किया गया है: कुल 66 सिस्टम का परीक्षण किया गया, जिनमें से 49 का सभी 11 बेंचमार्क (8 FINESSE + 3 सार्वजनिक) पर पूर्ण कवरेज है, और 33 मॉडल मुख्य तालिकाओं में शामिल हैं। शीर्ष परिणाम GPT-5.5 (परीक्षा-जैसे पर 0.906, ट्रेडिंग/टीए पर 0.876), Claude Opus 4.8 (परीक्षा-जैसे पर 0.860, ट्रेडिंग/टीए पर 0.856) और अन्य ने प्राप्त किए।
स्रोत: Habr — хаб NLP — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार