Dónde almacenan los hechos los LLM: Mover la Torre Eiffel de París a Roma
OpenAI
Los investigadores probaron el método ROME en GPT-2 XL para editar un hecho específico en los pesos del modelo: cambiar la ubicación de la Torre Eiffel de París a Roma. El experimento confirmó que la edición funciona en múltiples formulaciones y que los hechos vecinos permanecen intactos. Esto demuestra cómo se puede dirigir el conocimiento paramétrico sin un reentrenamiento completo.
En un experimento, se aplicó el método ROME (edición de modelos de rango uno) al modelo GPT-2 XL para cambiar el hecho de que la Torre Eiffel está en París a Roma. El modelo, con 1.56 mil millones de parámetros, fue elegido porque sus pesos son de acceso abierto y es compatible con la implementación original de ROME. Antes de la edición, el modelo prefería consistentemente París en varias indicaciones, con probabilidades que iban del 2% al 49%. Después de una edición específica, el modelo cambió su preferencia a Roma en todas las formulaciones probadas, y otros datos sobre la Torre Eiffel permanecieron sin cambios. El método modifica una matriz en la red de avance (FFN), que actúa como memoria asociativa para hechos. El experimento también destacó que los hechos no se almacenan como neuronas discretas, sino que se distribuyen en toda la red, y que ROME puede ajustar una asociación específica sin un reentrenamiento completo. Finalmente, se restauraron los pesos originales, confirmando que la edición era reversible.
Fuente: Habr — хаб ИИ —
original
