AraştırmaYapay Zeka Güvenliği 🇷🇺 27.07.2026 13:06

NeurIPS Eğitiminden Kıyaslama Oluşturma İçin 6 Ders

Google DeepMindGoogle DeepMind
SWE-bench ve GPQA'nın yazarları NeurIPS'de kıyaslama oluşturmada yapılan temel hataları tartıştı: metriklerin zorbalığı, kitle kaynak kullanımının öznelliği, büyük dil modellerini değerlendirici olarak kullanmanın tehlikesi ve dinamik test ihtiyacı. Ana öneriler — doymuş kıyaslamalardan kaçının, çok kipliliği kontrol edin ve sonuçları güven aralıklarıyla yayımlayın.
NeurIPS'teki 'Kıyaslama Sanatı' eğitiminde, SWE-bench ve GPQA'nın yazarları ile Google DeepMind, NYU ve Berkeley'den araştırmacılar, kıyaslama oluşturmadaki temel sorunları ve tuzakları tartıştı. Bunlar arasında, ölçütlerin modellerin testi 'kırmasına' izin veren tatlı noktalara sahip olduğu metrik tiranlığı yer alıyor; Pearson korelasyonu bu noktaları tespit edemiyor. Ayrıca, LLM'lerin değerlendirme kaynağı olarak kullanılmasının tehlikeli olduğu belirtildi: yalnızca kalibrasyon setinde insanlarla korelasyon gösteriyorlar ve önyargı, kendi sonuçlarını şişiriyor. Doğru olan tek yaklaşım, modelin başarısız olduğu örnekler üretmektir. Kıyaslama oluşturucularının yaptığı altı büyük hata arasında: en iyi modelde %70-80 doğrulukla kıyaslama başlatmak (hedef %0-1 olmalıdır), görevin gerçek çoklu ortam doğrulamasının yapılmaması, kişinin kendi zeka teorisine güvenmesi, kalabalık spam'ini filtrelememek (rastgele yanıtların %25'ine kadar), tek bir kalabalık çalışan üzerinde yoğunlaşmak ve p-değerleri ile güven aralıkları olmadan sonuçları yayınlamak. Gelecekte, dinamik kıyaslamalara, LLM'lerin insanlar üzerindeki uzun vadeli etkilerinin incelenmesine, model bilgisinin kalibrasyonuna ve bir kedinin çözebileceği ancak GPT'nin çözemeyeceği görevlere ihtiyacımız var.
Kaynak: Хабр — Data Mining — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler