研究 🇷🇺 04.08.2026 09:03

大規模言語モデルが事実を保存する場所:エッフェル塔をパリからローマへ移動する

OpenAIOpenAI
研究者らは、GPT-2 XLでROMEメソッドをテストし、モデルの重みにおける特定の事実、すなわちエッフェル塔の位置をパリからローマに変更する編集を行いました。実験により、この編集が複数の言い回しで機能し、近隣の事実がそのまま保持されることが確認されました。これは、パラメトリック知識を完全な再トレーニングなしにターゲット指定できることを示しています。
実験では、ROME(Rank-One Model Editing)法をGPT-2 XLモデルに適用し、エッフェル塔がパリにあるという事実をローマに変更しました。このモデルは15.6億のパラメータを持ち、その重みが公開されており、元のROME実装でサポートされているため選択されました。編集前、モデルは複数のプロンプトで一貫してパリを好み、その確率は2%から49%の範囲でした。一度の対象を絞った編集後、モデルはテストしたすべての表現でローマを好むようになり、エッフェル塔に関する他の事実は変更されませんでした。この方法は、フィードフォワードネットワーク(FFN)内の行列を修正します。FFNは事実の連想記憶として機能します。実験ではまた、事実が離散的なニューロンとして保存されるのではなく、ネットワーク全体に分散していること、そしてROMEが完全な再訓練なしで特定の関連性を調整できることも強調されました。最後に、元の重みが復元され、編集が可逆的であることが確認されました。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース