L'auto-description comme condition d'émergence d'un signe dans un réseau de neurones
Anthropic
L'article explore le rôle de l'auto-description (rapport) dans la formation d'un signe – une unité séparée et lisible de l'extérieur au sein d'un réseau de neurones. À l'aide de micro-modèles, l'auteur montre que sans l'obligation de nommer une règle, celle-ci ne se cristallise pas, même si le calcul a lieu. L'auto-description ne reflète pas une connaissance déjà prête mais la constitue, transformant le réseau d'un calculateur en un système de pensée primitif. Le mécanisme explique également l'apparition d'hallucinations dans les grands modèles.
L'auteur poursuit l'analyse de l'espace-J, ouvert par Anthropic, en se concentrant sur deux questions : la possibilité d'un métasigne et l'essence de l'auto-description du réseau de neurones. Des expériences sur des micromodèles (quatre couches) ont montré qu'un métasigne – un signe combinant plusieurs signes de base – ne pouvait être obtenu en raison de problèmes d'apprenabilité et de mesurabilité ; l'auteur suggère qu'il faut le chercher dans un mélange d'experts. L'auto-description, quant à elle, s'est avérée n'être pas une superstructure mais une condition d'émergence d'un signe : un réseau doté d'une tête de rapport, obligé de nommer la règle appliquée, cristallise toujours un axe de contrôle, alors que sans rapport il ne le fait jamais, et la précision de résolution de la tâche est identique dans les deux cas. Le nom apparaît avant la capacité : à la millième époque, la règle est lue presque parfaitement, bien que la tâche principale soit résolue au niveau du hasard. Sans rapport, la structure se désintègre ; avec rapport, elle persiste pendant 40 000 époques. L'auteur conclut que l'obligation de nommer n'étiquette pas quelque chose de prêt, mais découpe un objet stable dans le flux computationnel. L'attente de la tête de rapport est aveugle au contenu – elle exige une unité présentable mais ne vérifie pas sa vérité ; cela donne naissance à la fois au signe et aux hallucinations. L'hypothèse de l'auto-modélisation du réseau de neurones (le rapport comme description de ses propres états) n'a pas pu être testée en raison des limitations du micro-réseau ; indirectement, la divergence entre le rapport et le calcul réel la soutient.
Source: Habr — хаб ИИ —
original
