Missä suuret kielimallit säilyttävät faktatietonsa: Eiffel-tornin siirtäminen Pariisista Roomaan
OpenAI
Tutkijat testasivat ROME-menetelmää GPT-2 XL -mallilla muokatakseen tietyn faktan mallin painoissa: Eiffel-tornin sijainnin muuttamisen Pariisista Roomaan. Kokeilu vahvisti, että muokkaus toimii useilla eri sanamuodoilla ja että viereiset faktat säilyvät ennallaan. Tämä osoittaa, miten parametrinen tieto voidaan kohdentaa ilman täyttä uudelleenkoulutusta.
Kokeessa GPT-2 XL -malliin sovellettiin ROME (Rank-One Model Editing) -menetelmää, jotta Eiffel-tornin sijainti vaihdettaisiin Pariisista Roomaan. Malli, jossa on 1,56 miljardia parametria, valittiin, koska sen painot ovat avoimesti saatavilla ja alkuperäinen ROME-toteutus tukee sitä. Ennen muokkausta malli suosi johdonmukaisesti Pariisia useissa kehotteissa, todennäköisyyksien vaihdellessa 2 prosentista 49 prosenttiin. Yhden kohdennetun muokkauksen jälkeen malli siirtyi suosimaan Roomaa kaikissa testatuissa muotoiluissa, ja muut Eiffel-tornia koskevat faktat pysyivät ennallaan. Menetelmä muokkaa matriisia feed-forward-verkossa (FFN), joka toimii faktojen assosiatiivisena muistina. Kokeessa tuotiin myös esiin, että faktat eivät varastoidu erillisinä neuroneina vaan ovat jakautuneet verkon alueelle, ja että ROME voi säätää tiettyä assosiaatiota ilman täyttä uudelleenkoulutusta. Lopuksi alkuperäiset painot palautettiin, mikä vahvisti muokkauksen olevan palautuva.
Lähde: Habr — хаб ИИ —
Alkuperäinen
