TutkimusMallit 🇷🇺 27.07.2026 04:05

Finam AI Lab päivittää rahoitusalan benchmark FINESSE-Benchin suurille kielimalleille

AnthropicAnthropic Moonshot AIMoonshot AI Google/DeepMindGoogle/DeepMind MiniMaxMiniMax OpenAIOpenAI MetaMeta DeepSeekDeepSeek MistralMistral СберСбер ЯндексЯндекс Т-БанкТ-Банк
Finamin tekoälylaboratorio on julkaissut päivitetyn version rahoitusalan benchmarkista FINESSE-Bench. Uusi versio lisää teknisten analyysien datasettiin CFTe-tyyppisen tason 1, korjaa 169 CFA-tyyppisen tason 1 kysymystä, parantaa metrilaskentaa bootstrap-menetelmällä ja laajentaa mallipoolia 33 malliin vertailutaulukoissa.
Finam Artificial Intelligence Lab on julkaissut päivityksen FINESSE-Bench-finanssivertailutestille, joka on suunniteltu arvioimaan suurten kielimallien (large language models, LLM) tietämystä ja taitoja finanssialalla. Keskeisiä muutoksia ovat: 169 ongelmallisen kysymyksen korjaaminen CFA-tason 1 aineistossa; uuden CFTe-tason 1 aineiston lisääminen, joka sisältää 781 kysymystä teknisen analyysin perusteista; siirtyminen luottamusvälin laskentaan bootstrap-menetelmällä entistä vankempaa mallien vertailua varten; kerrostetun bootstrap-menetelmän käyttö tulosten yhdistämisessä vertailuryhmittäin; aineistojen erottelukyvyn ja kyllästymisasteen erillinen arviointi (havaittiin, että suurin osa FINESSE-kysymyksistä sijoittuu väliasteelle, mikä tarjoaa hyvän diagnostisen arvon). Mallivalikoimaa on laajennettu: yhteensä 66 järjestelmää testattiin, joista 49 kattaa kaikki 11 vertailutestiä (8 FINESSE + 3 julkista), ja 33 mallia on päätaulukoissa. Parhaat tulokset saavuttivat GPT-5.5 (0,906 tenttimäisissä, 0,876 kaupankäynti/teknisessä analyysissa), Claude Opus 4.8 (0,860 tenttimäisissä, 0,856 kaupankäynti/teknisessä analyysissa) ja muita.
Lähde: Habr — хаб NLP — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset