ニューラルネットワークにおける記号の出現条件としての自己記述
Anthropic
この記事では、ニューラルネットワーク内で外部から読み取り可能な独立した単位である記号の形成における自己記述(レポート)の役割を探求しています。マイクロモデルを用いて、著者はルールに名前を付ける要件がなければ、計算が行われていてもルールが結晶化しないことを示しています。自己記述は既製の知識を反映するのではなく、それを構成し、ネットワークを計算機から原始的な思考システムへと変容させます。このメカニズムは、大規模モデルにおける幻覚の発生も説明します。
著者は、Anthropicが切り開いたJ空間の分析を続け、メタサインの可能性とニューラルネットワークの自己記述の本質という二つの問いに焦点を当てている。微小モデル(4層)での実験では、メタサイン(複数の基本サインを組み合わせたサイン)は学習可能性と測定可能性の問題から得られなかった。著者は、それを専門家の混合の中に求めるべきだと示唆している。一方、自己記述は上部構造ではなく、サインが出現するための条件であることが判明した。レポートヘッドを持ち、適用するルールを命名することを義務付けられたネットワークは、常に制御軸を結晶化するが、レポートがない場合は決して結晶化しない。タスク解決の精度は両方の場合で同じである。名前は能力に先立って現れる。1000エポック目では、ルールはほぼ完璧に読み取られるが、メインタスクはランダムレベルでしか解かれていない。レポートがないと構造は崩壊するが、レポートがあると40000エポック持続する。著者は、命名を要求することが既製のものにラベルを貼るのではなく、計算の流れから安定した対象を切り出すと結論づけている。レポートヘッドの期待は内容に盲目であり、提示可能な単位を要求するが、その真偽は検証しない。これがサインと幻覚の両方を生み出す。ニューラルネットワークの自己モデリング(レポートを自身の状態の記述とする)という仮説は、マイクロネットワークの限界のため検証できなかった。間接的には、レポートと実際の計算との間の乖離がこれを支持している。
出典: Habr — хаб ИИ —
原文
