MERA Reason: Papan Peringkat Publik Baru untuk Mengevaluasi Model Penalaran dalam Bahasa Rusia
Т-Банк
Alibaba/Qwen
Papan peringkat publik baru bernama MERA Reason (bagian dari platform MERA TEXT) telah diluncurkan untuk mengevaluasi kemampuan penalaran model AI khususnya pada tugas matematika dan penalaran berbahasa Rusia. Papan peringkat ini menggabungkan empat kumpulan data yang berbeda: Luzitania (matematika tingkat olimpiade keras), TMath (berbagai masalah matematika), MMReD (penalaran multi-hop dengan konteks padat), dan bertujuan menyediakan tolok ukur yang objektif dan dapat direproduksi untuk model penalaran.
Papan peringkat MERA Reason diperkenalkan untuk menjawab kebutuhan pengukuran objektif kemampuan penalaran pada model bahasa besar, khususnya untuk bahasa Rusia. Papan ini terdiri dari empat kumpulan data: Luzitania (251 soal matematika sulit dari olimpiade tingkat tinggi, difilter berdasarkan tingkat kesulitan menggunakan GPT-OSS-120B), TMath (310 soal dari olimpiade Rusia yang mencakup aljabar, geometri, kombinatorika, dan lain-lain), dan MMReD (tolok ukur sintetis untuk penalaran konteks padat di mana setiap token relevan). Papan peringkat ini memungkinkan perbandingan model penalaran dalam lingkungan yang dapat direproduksi dan akan menjadi bagian dari pembaruan yang lebih besar pada platform MERA yang diharapkan hadir musim panas ini.
Sumber: Habr — хаб ИИ —
asli
