Alibaba Qwen, Matematiksel Akıl Yürütme için ProcessBench ve Geliştirilmiş Süreç Ödül Modellerini Yayınladı
Alibaba/Qwen
OpenAI
Alibaba'nın Qwen ekibi, matematiksel akıl yürütme adımlarındaki hataları tespit etmek için bir kıyaslama aracı olan ProcessBench'i açık kaynak olarak yayınladı ve Qwen2.5-Math tabanlı iki yeni Süreç Ödül Modeli (PRM) çıkardı. Modeller, mevcut açık kaynak PRM'lerden daha iyi performans gösteriyor ve güçlü hata tanımlama yeteneklerine sahip.
Alibaba'nın Qwen ekibi, rekabet ve olimpiyat düzeyindeki matematik problemlerine odaklanan, insan uzmanların adım adım çözümlerdeki en erken hatalı adımı işaretlediği 3.400 test senaryosundan oluşan ProcessBench adlı bir kıyaslama aracı tanıttı. Ayrıca, Qwen2.5-Math-Instruct modellerinden ince ayar yapılmış iki yeni Süreç Ödül Modeli (Process Reward Model - PRM) olan Qwen2.5-Math-PRM-7B ve Qwen2.5-Math-PRM-72B'yi yayınladılar. Yedi matematik kıyaslamasında En İyi-N değerlendirmesinde (N=8), Qwen2.5-Math-PRM-7B, çoğunluk oylamasını ortalama %1,4 oranında geride bıraktı ve benzer ölçekteki diğer PRM'lerle eşleşti veya onları geçti. ProcessBench üzerinde Qwen2.5-Math-PRM-7B, GPT-4o-0806 ve tüm açık kaynak modelleri geride bırakarak yalnızca o1-mini'nin ardından ikinci sırada yer aldı. Ekip ayrıca, Sonuç Ödül Modeli (Outcome Reward Model - ORM) Qwen2.5-Math-RM-72B'nin, bazı PRM'leri geride bırakarak şaşırtıcı bir adım-hatası tespit yeteneği gösterdiğini belirtti. Çalışma, büyük dil modellerinin (LLM) akıl yürütmesinde süreç denetimini iyileştirmeyi hedefliyor.
Kaynak: Alibaba Qwen —
orijinal
