Google arvioi suurten kielimallien käyttäytymistaipumusten yhdenmukaisuutta
Google/DeepMind
Google Research esittelee kehyksen, joka muuntaa psykologiset kyselylomakkeet tilannearviointitesteiksi (SJT) arvioidakseen kielimallien käyttäytymisen yhdenmukaisuutta. 25 mallin testaus paljastaa, että pienemmät mallit poikkeavat usein ihmiskonsensuksesta, kun taas suuremmat mallit osoittavat parannettua mutta epätäydellistä yhdenmukaisuutta. Tutkimus havaitsee myös, että mallit ovat liian itsevarmoja, kun ihmisten mielipiteet eroavat.
Google Research esittelee viitekehyksen, jolla arvioidaan kielimallien käyttäytymistaipumuksia mukauttamalla vakiintuneita psykologisia kyselylomakkeita tilannearviointitesteiksi. Viitekehys testaa malleja realistisissa skenaarioissa, kuten ammatillinen tyyneys ja konfliktinratkaisu. 25 kielimallin analyysi osoittaa, että pienemmillä malleilla (alle 25 miljardia parametria) on huomattavasti heikompi suuntautumisen yhdenmukaisuus, usein lähellä sattumanvaraista tasoa, kun taas suuremmat huippumallit (yli 120 miljardia parametria) saavuttavat lähes täydellisen yhdenmukaisuuden yksimielisen ihmiskonsensuksen alaisuudessa, mutta jäävät 80 prosentin alku- ja keskivaiheille, kun konsensus on alhaisempi. Mallit kannustavat tunneperäiseen avoimuuteen, kun ihmiset suosittelevat tyyneyttä, asettavat harmonian itsevarmuuden edelle ja osoittavat korkeampaa impulsiivisuutta. Tutkimus paljastaa myös, että mallit ovat systemaattisesti yli-itsevarmoja, kun ihmisten arvioijat ovat eri mieltä, eivätkä ne kykene edustamaan mielipiteiden kirjoa. Tämä korostaa tarvetta paremmalle käyttäytymisen yhdenmukaistamiselle, jotta sosiaalista dynamiikkaa voidaan navigoida asianmukaisesti.
Lähde: Google Research —
Alkuperäinen
