推理模型需要新的衡量标准:公共排行榜MERA Reason发布
MERA Reason排行榜已发布,用于评估俄语推理模型。它包括四个任务集:Luzitania(奥林匹克水平数学)、TMath(广泛问题)、MMReD(密集上下文推理)以及一个即将推出的组件。目标是客观衡量模型构建推理链的能力,而不仅仅是复现知识。
Т-Банк
Alibaba/Qwen
Habr — хаб ИИ24.07 · 11:01
MERA Reason排行榜已发布,用于评估俄语推理模型。它包括四个任务集:Luzitania(奥林匹克水平数学)、TMath(广泛问题)、MMReD(密集上下文推理)以及一个即将推出的组件。目标是客观衡量模型构建推理链的能力,而不仅仅是复现知识。
Т-Банк
Alibaba/Qwen