Waar LLM's feiten opslaan: de Eiffeltoren verplaatsen van Parijs naar Rome
OpenAI
Onderzoekers testten de ROME-methode op GPT-2 XL om een specifiek feit in de gewichten van het model te bewerken: het wijzigen van de locatie van de Eiffeltoren van Parijs naar Rome. Het experiment bevestigde dat de bewerking werkt bij verschillende formuleringen en dat naburige feiten intact blijven. Dit toont aan hoe parametrische kennis gericht kan worden aangepast zonder volledige hertraining.
In een experiment werd de ROME-methode (Rank-One Model Editing) toegepast op het GPT-2 XL-model om het feit dat de Eiffeltoren in Parijs staat te veranderen naar Rome. Het model, met 1,56 miljard parameters, werd gekozen omdat de gewichten openlijk toegankelijk zijn en het wordt ondersteund door de oorspronkelijke ROME-implementatie. Vóór het bewerken gaf het model consequent de voorkeur aan Parijs bij verschillende prompts, met kansen variërend van 2% tot 49%. Na één gerichte bewerking verschoof het model zijn voorkeur naar Rome in alle geteste formuleringen, en andere feiten over de Eiffeltoren bleven ongewijzigd. De methode wijzigt een matrix in het feed-forward netwerk (FFN), dat fungeert als associatief geheugen voor feiten. Het experiment benadrukte ook dat feiten niet zijn opgeslagen als discrete neuronen, maar verspreid zijn over het netwerk, en dat ROME een specifieke associatie kan aanpassen zonder volledige hertraining. Tot slot werden de oorspronkelijke gewichten hersteld, wat bevestigde dat de bewerking omkeerbaar was.
Bron: Habr — хаб ИИ —
origineel
