Käyttäytymistaipumusten johdonmukaisuuden arviointi suurissa kielimalleissa
Google/DeepMind
Google Research esitteli uuden kehyksen suurten kielimallien (LLM) käyttäytymistaipumusten arvioimiseksi, joka perustuu psykologisiin kyselyihin ja tilannekokeisiin. 25 mallin analyysi osoitti, että pienet mallit osoittavat heikkoa yhdenmukaisuutta ihmiskonsensuksen kanssa, kun taas suuret mallit yliarvioivat luottamustaan, kun ihmisten yksimielisyys on heikko, mikä viittaa parannetun käyttäytymisen yhdenmukaistamisen tarpeeseen.
Googlen tutkijat esittelivät systemaattisen arviointikehyksen suurten kielimallien (Large Language Models, LLM) käyttäytymistaipumuksille, muuntaen standardit psykologiset kyselylomakkeet laajamittaisiksi tilannetesteiksi (Situational Judgement Tests, SJT). Työssä käytettiin validoituja työkaluja, kuten Interpersonal Reactivity Index (IRI) -empatiamittaria ja Emotion Regulation Questionnaire (ERQ) -tunteidensäätelymittaria. Malleja testattiin realistisissa skenaarioissa, jotka kattoivat ammatillisen käyttäytymisen, konfliktinratkaisun ja arkiset tehtävät. 25 LLM:n analyysi paljasti kahdenlaisia eroavaisuuksia: poikkeama ihmisten konsensuksesta, kun korkea annotoijien välinen yksimielisyys vallitsi, sekä mielipiteiden moninaisuuden riittämätön heijastaminen, kun konsensus oli alhainen. Pienet mallit (alle 25 miljardia parametria) osoittivat huomattavasti huonompaa yhtenevyyttä, eivätkä usein erottaneet piirteiden asianmukaista ilmaisua tai tukahduttamista. Suuret mallit (yli 120 miljardia parametria) saavuttivat lähes täydellisen yhtenevyyden yksimielisessä konsensuksessa, mutta kun konsensus oli alle 90 prosenttia, niiden suorituskyky saavutti 80 prosentin tason. Laadullinen analyysi osoitti, että mallit taipuvat kannustamaan emotionaalista avoimuutta ammatillisissa tilanteissa, joissa ihmiset suosittelevat pidättyväisyyttä, ja sosiaalisissa kiistoissa ne asettavat harmonian etusijalle oman kannan puolustamisen sijaan. Lisäksi havaittiin systemaattinen itseluottamuksen yliarviointi: kaikki 25 mallia eivät vähentäneet luottamustaan, kun ihmisten konsensus oli alhainen, mikä rikkoo pluralistisen jakautumisen periaatetta. Kehys paljasti myös eroja mallien itseraporttien ja niiden todellisen käyttäytymisen välillä: esimerkiksi mallit raportoivat usein matalasta impulsiivisuudesta, mutta todellisuudessa ne ovat taipuvaisia impulsiivisiin toimiin.
Lähde: Google Research —
Alkuperäinen
