Où les LLM stockent les faits : déplacer la tour Eiffel de Paris à Rome
OpenAI
Des chercheurs ont testé la méthode ROME sur GPT-2 XL pour modifier un fait spécifique dans les poids du modèle : changer la localisation de la tour Eiffel de Paris à Rome. L'expérience a confirmé que la modification fonctionne avec plusieurs formulations et que les faits voisins restent intacts. Cela démontre comment les connaissances paramétriques peuvent être ciblées sans réentraînement complet.
Lors d'une expérience, la méthode ROME (Rank-One Model Editing) a été appliquée au modèle GPT-2 XL afin de modifier le fait que la tour Eiffel se trouve à Paris pour le remplacer par Rome. Le modèle, doté de 1,56 milliard de paramètres, a été choisi car ses poids sont librement accessibles et qu'il est pris en charge par l'implémentation originale de ROME. Avant la modification, le modèle préférait systématiquement Paris pour plusieurs formulations, avec des probabilités allant de 2 % à 49 %. Après une modification ciblée, le modèle a basculé sa préférence vers Rome dans toutes les formulations testées, et les autres faits concernant la tour Eiffel sont restés inchangés. La méthode modifie une matrice du réseau feed-forward (FFN), qui agit comme une mémoire associative pour les faits. L'expérience a également mis en évidence que les faits ne sont pas stockés sous forme de neurones discrets mais sont répartis dans le réseau, et que ROME peut ajuster une association spécifique sans réentraînement complet. Enfin, les poids d'origine ont été restaurés, confirmant que la modification était réversible.
Source: Habr — хаб ИИ —
original
