OnderzoekModellen 🇷🇺 27.07.2026 04:05

Finam AI Lab werkt financiële benchmark FINESSE-Bench voor LLMs bij

AnthropicAnthropic Moonshot AIMoonshot AI Google/DeepMindGoogle/DeepMind MiniMaxMiniMax OpenAIOpenAI MetaMeta DeepSeekDeepSeek MistralMistral СберСбер ЯндексЯндекс Т-БанкТ-Банк
Het Artificial Intelligence Laboratory van Finam heeft een bijgewerkte versie uitgebracht van de financiële benchmark FINESSE-Bench. De nieuwe versie voegt een technische analysedataset CFTe-like Level 1 toe, herstelt 169 CFA-like Level 1-vragen, verbetert de metriekberekening met bootstrapping en breidt de modelpool uit naar 33 in vergelijkende tabellen.
Finam Artificial Intelligence Lab heeft een update uitgebracht van de FINESSE-Bench financiële benchmark, ontworpen om de kennis en vaardigheden van grote taalmodellen (Large Language Models, LLM's) op financieel gebied te evalueren. Belangrijke veranderingen zijn: het oplossen van 169 problematische vragen in de CFA-achtige dataset van niveau 1; het toevoegen van een nieuwe CFTe-achtige dataset van niveau 1 met 781 vragen over de grondbeginselen van technische analyse; de overgang naar betrouwbaarheidsintervalberekening via bootstrapping voor robuustere modelvergelijking; het gebruik van gestratificeerde bootstrapping om resultaten per benchmarkgroep te aggregeren; afzonderlijke beoordeling van het onderscheidend vermogen en de verzadiging van datasets (er werd vastgesteld dat de meeste FINESSE-vragen in de tussenzone vallen, wat een goede diagnostische waarde biedt). De modelpool is uitgebreid: in totaal werden 66 systemen getest, waarvan er 49 volledige dekking hebben over alle 11 benchmarks (8 FINESSE + 3 publieke), en 33 modellen zijn opgenomen in de hoofdtabellen. Topresultaten werden behaald door GPT-5.5 (0,906 op examenachtig, 0,876 op handel/technische analyse), Claude Opus 4.8 (0,860 op examenachtig, 0,856 op handel/technische analyse) en anderen.
Bron: Habr — хаб NLP — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws