Nghiên cứu 🇷🇺 24.07.2026 11:01

MERA Reason: Bảng xếp hạng công khai mới đánh giá mô hình suy luận trên tiếng Nga

Т-БанкТ-Банк Alibaba/QwenAlibaba/Qwen
Một bảng xếp hạng công khai mới có tên MERA Reason (thuộc nền tảng MERA TEXT) đã được ra mắt nhằm đánh giá khả năng suy luận của các mô hình trí tuệ nhân tạo trên các bài toán và nhiệm vụ suy luận bằng tiếng Nga. Bảng xếp hạng này kết hợp bốn tập dữ liệu riêng biệt: Luzitania (bài toán olympiad khó), TMath (nhiều bài toán đa dạng), MMReD (suy luận đa bước với ngữ cảnh dày đặc), và nhằm cung cấp một chuẩn mực khách quan, có thể tái lập cho các mô hình suy luận.
Bảng xếp hạng MERA Reason được giới thiệu nhằm đáp ứng nhu cầu đo lường khách quan khả năng suy luận của các mô hình ngôn ngữ lớn, đặc biệt là đối với tiếng Nga. Nó bao gồm bốn tập dữ liệu: Luzitania (251 bài toán khó từ các kỳ thi Olympic cấp cao, được lọc theo độ khó bằng GPT-OSS-120B), TMath (310 bài toán từ các kỳ thi Olympic Nga bao gồm đại số, hình học, tổ hợp, v.v.) và MMReD (một chuẩn tổng hợp cho suy luận ngữ cảnh dày đặc, nơi mọi token đều có liên quan). Bảng xếp hạng cho phép so sánh các mô hình suy luận trong môi trường có thể tái tạo và sẽ là một phần của bản cập nhật lớn hơn cho nền tảng MERA dự kiến vào mùa hè này.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới