OnderzoekAI-veiligheid 🇺🇸 27.07.2026 16:04

Google evalueert afstemming van gedragstendensen in grote taalmodellen

Google/DeepMindGoogle/DeepMind
Google Research introduceert een raamwerk dat psychologische vragenlijsten omzet in situationele beoordelingstests (SJT's) om de gedragsmatige afstemming van grote taalmodellen te beoordelen. Uit tests met 25 modellen blijkt dat kleinere modellen vaak afwijken van de menselijke consensus, terwijl grotere modellen een verbeterde maar onvolmaakte afstemming vertonen. De studie toont ook aan dat modellen overmoedig zijn wanneer menselijke meningen uiteenlopen.
Google Research presenteert een raamwerk voor het evalueren van gedragsdisposities in LLM's door middel van aangepaste psychologische vragenlijsten, omgezet in situationele oordelstesten. Het raamwerk test modellen in realistische scenario's zoals professionele beheersing en conflictoplossing. Analyse van 25 LLM's toont aan dat kleinere modellen (<25B parameters) aanzienlijk lagere directionele overeenstemming hebben, vaak op bijna-toevalsniveau, terwijl grotere grensverleggende modellen (>120B) bijna perfecte overeenstemming bereiken bij unanieme menselijke consensus, maar stagneren in de lage tot midden 80 als de consensus lager is. Modellen hebben de neiging om emotionele openheid aan te moedigen waar mensen beheersing aanbevelen, harmonie te prioriteren boven assertiviteit en een hogere impulsiviteit te vertonen. De studie onthult ook dat modellen systematisch overmoedig zijn wanneer menselijke annotatoren het oneens zijn, waarbij ze er niet in slagen het scala aan meningen weer te geven. Dit benadrukt de behoefte aan betere gedragsmatige afstemming om sociale dynamiek adequaat te navigeren.
Bron: Google Research — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws