Redenerende modellen hebben een nieuwe meting nodig: publieke ranglijst MERA Reason onthuld
De MERA Reason-ranglijst is gelanceerd om redenerende modellen in het Russisch te evalueren. Het bevat vier taakgroepen: Luzitania (wiskunde op olympiadeniveau), TMath (een breed scala aan problemen), MMReD (redeneren met dichte context) en een aanstaand onderdeel. Het doel is om objectief het vermogen van een model te meten om redeneerketens op te bouwen, niet alleen kennis te reproduceren.
Т-Банк
Alibaba/Qwen
Habr — хаб ИИ24.07 · 11:01
