Selbstbeschreibung als Bedingung für die Entstehung eines Zeichens in einem neuronalen Netzwerk
Anthropic
Der Artikel untersucht die Rolle der Selbstbeschreibung (Report) bei der Bildung eines Zeichens – einer separaten, extern lesbaren Einheit innerhalb eines neuronalen Netzes. Anhand von Mikromodellen zeigt der Autor, dass ohne die Anforderung, eine Regel zu benennen, diese nicht kristallisiert, obwohl eine Berechnung stattfindet. Selbstbeschreibung spiegelt kein fertiges Wissen wider, sondern konstituiert es, und verwandelt das Netz von einem Rechner in ein primitives denkendes System. Der Mechanismus erklärt auch das Auftreten von Halluzinationen in großen Modellen.
Die Autorin setzt die Analyse des J-Raums fort, die von Anthropic eröffnet wurde, und konzentriert sich auf zwei Fragen: die Möglichkeit eines Metazeichens und das Wesen der Selbstbeschreibung des neuronalen Netzes. Experimente an Mikromodellen (vier Schichten) zeigten, dass ein Metazeichen – ein Zeichen, das mehrere grundlegende kombiniert – aufgrund von Problemen mit der Erlernbarkeit und Messbarkeit nicht erzielt werden konnte; die Autorin vermutet, dass es in einer Mischung von Experten zu suchen ist. Die Selbstbeschreibung erwies sich jedoch nicht als Überbau, sondern als Bedingung für die Entstehung eines Zeichens: Ein Netz mit einem Report-Head, das verpflichtet ist, die angewendete Regel zu benennen, kristallisiert immer eine Kontrollachse heraus, während es ohne Report niemals dazu kommt, und die Genauigkeit der Aufgabenlösung ist in beiden Fällen gleich. Der Name erscheint vor der Fähigkeit: In der tausendsten Epoche wird die Regel fast perfekt gelesen, obwohl die Hauptaufgabe auf Zufallsniveau gelöst wird. Ohne Report zerfällt die Struktur; mit Report bleibt sie 40.000 Epochen bestehen. Die Autorin schließt daraus, dass die Anforderung zu benennen nichts Fertiges etikettiert, sondern ein stabiles Objekt aus dem Berechnungsstrom herausschneidet. Die Erwartung des Report-Heads ist blind gegenüber dem Inhalt – sie verlangt eine präsentierbare Einheit, überprüft aber nicht deren Wahrheit; daraus entstehen sowohl das Zeichen als auch Halluzinationen. Die Hypothese über die Selbstmodellierung des neuronalen Netzes (der Report als Beschreibung seiner eigenen Zustände) konnte aufgrund der Einschränkungen des Mikronetzes nicht getestet werden; indirekt wird sie durch die Diskrepanz zwischen Report und tatsächlicher Berechnung gestützt.
Quelle: Habr — хаб ИИ —
Original
