RisetModel 🇷🇺 27.07.2026 04:05

Finam AI Lab Memperbarui Tolok Ukur Keuangan FINESSE-Bench untuk LLM

AnthropicAnthropic Moonshot AIMoonshot AI Google/DeepMindGoogle/DeepMind MiniMaxMiniMax OpenAIOpenAI MetaMeta DeepSeekDeepSeek MistralMistral СберСбер ЯндексЯндекс Т-БанкТ-Банк
Laboratorium Kecerdasan Buatan Finam telah merilis versi terbaru dari tolok ukur keuangan FINESSE-Bench. Versi baru ini menambahkan kumpulan data analisis teknis CFTe-like Level 1, memperbaiki 169 pertanyaan CFA-like Level 1, meningkatkan perhitungan metrik dengan bootstrapping, dan memperluas kumpulan model menjadi 33 dalam tabel perbandingan.
Finam Artificial Intelligence Lab telah merilis pembaruan pada tolok ukur keuangan FINESSE-Bench, yang dirancang untuk mengevaluasi pengetahuan dan keterampilan model bahasa besar (LLM) di bidang keuangan. Perubahan utama meliputi: memperbaiki 169 soal bermasalah dalam dataset CFA-like Level 1; menambahkan dataset CFTe-like Level 1 baru dengan 781 soal tentang dasar-dasar analisis teknikal; beralih ke perhitungan interval kepercayaan melalui bootstrapping untuk perbandingan model yang lebih kuat; menggunakan stratified bootstrapping untuk mengagregasi hasil berdasarkan kelompok tolok ukur; penilaian terpisah terhadap daya diskriminatif dan saturasi dataset (ditemukan bahwa sebagian besar soal FINESSE berada di zona menengah, memberikan nilai diagnostik yang baik). Kumpulan model telah diperluas: total 66 sistem diuji, di mana 49 di antaranya memiliki cakupan penuh di seluruh 11 tolok ukur (8 FINESSE + 3 publik), dan 33 model dimasukkan dalam tabel utama. Hasil terbaik dicapai oleh GPT-5.5 (0,906 pada soal ujian, 0,876 pada perdagangan/analisis teknikal), Claude Opus 4.8 (0,860 pada soal ujian, 0,856 pada perdagangan/analisis teknikal), dan lainnya.
Sumber: Habr — хаб NLP — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru