연구 🇷🇺 04.08.2026 09:03

LLM이 사실을 저장하는 위치: 에펠탑을 파리에서 로마로 옮기기

OpenAIOpenAI
연구진은 GPT-2 XL 모델에 ROME 방법을 적용하여 가중치 내 특정 사실(에펠탑의 위치를 파리에서 로마로 변경)을 편집하는 실험을 수행했습니다. 실험 결과, 이러한 편집이 다양한 문장 표현에서도 일관되게 적용되며 주변의 다른 사실들은 그대로 유지된다는 것을 확인했습니다. 이는 전체 재훈련 없이도 파라메트릭 지식을 정밀하게 수정할 수 있음을 보여줍니다.
실험에서 ROME(Rank-One Model Editing) 방법이 GPT-2 XL 모델에 적용되어 에펠탑이 파리에 있다는 사실을 로마에 있다고 변경했습니다. 15억 6천만 개의 매개변수를 가진 이 모델은 가중치가 공개적으로 접근 가능하고 원래 ROME 구현에서 지원되기 때문에 선택되었습니다. 편집 전에 모델은 여러 프롬프트에서 일관되게 파리를 선호했으며, 확률은 2%에서 49% 사이였습니다. 한 번의 표적 편집 후, 모델은 모든 테스트된 표현에서 로마를 선호하도록 바뀌었고, 에펠탑에 대한 다른 사실들은 변경되지 않았습니다. 이 방법은 사실에 대한 연관 기억으로 작용하는 피드포워드 네트워크(FFN)의 행렬을 수정합니다. 실험은 또한 사실이 개별 뉴런에 저장되는 것이 아니라 네트워크 전체에 분산되어 있으며, ROME이 전체 재훈련 없이 특정 연관성을 조정할 수 있음을 강조했습니다. 마지막으로 원래 가중치가 복원되어 편집이 되돌릴 수 있음을 확인했습니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스