Google, büyük dil modellerinde davranışsal eğilimlerin uyumunu değerlendiriyor
Google/DeepMind
Google Research, psikolojik anketleri durumsal yargı testlerine (SJT'ler) dönüştürerek büyük dil modellerinin (LLM'ler) davranışsal uyumunu değerlendiren bir çerçeve tanıtıyor. 25 modelin test edilmesi, daha küçük modellerin genellikle insan fikir birliğinden saptığını, daha büyük modellerin ise iyileştirilmiş ancak kusurlu uyum gösterdiğini ortaya koyuyor. Çalışma ayrıca modellerin, insan görüşleri farklılaştığında aşırı güvenli olduğunu buluyor.
Google Araştırma, büyük dil modellerinde (LLM) davranışsal eğilimleri değerlendirmek için, yerleşik psikolojik anketleri durumsal yargı testlerine uyarlayan bir çerçeve sunuyor. Çerçeve, modelleri profesyonel soğukkanlılık ve çatışma çözümü gibi gerçekçi senaryolarda test ediyor. 25 LLM üzerinde yapılan analiz, daha küçük modellerin (<25 milyar parametre) belirgin şekilde daha düşük yönsel uyuma sahip olduğunu, genellikle şansa yakın oranlarda olduğunu; daha büyük sınır modellerinin (>120 milyar) ise oybirliğiyle insan fikir birliği altında neredeyse mükemmel uyum sağladığını, ancak fikir birliği daha düşük olduğunda yüzde 80'lerin alt-orta seviyelerinde plato yaptığını gösteriyor. Modeller, insanların soğukkanlılık önerdiği yerlerde duygusal açıklığı teşvik etme, atılganlık yerine uyumu önceliklendirme ve daha yüksek dürtüsellik sergileme eğiliminde. Çalışma ayrıca, insan etiketleyicilerin anlaşmazlığa düştüğü durumlarda modellerin sistematik olarak aşırı güvenli olduğunu ve görüş yelpazesini temsil etmekte başarısız olduğunu ortaya koyuyor. Bu, sosyal dinamiklerde uygun şekilde gezinmek için daha iyi davranışsal uyuma duyulan ihtiyacı vurguluyor.
Kaynak: Google Research —
orijinal
