Le compilateur qui hallucine : compiler des programmes directement dans les poids d'un réseau de neurones
DeepMind
Des chercheurs développent des compilateurs qui traduisent des programmes lisibles par l'homme directement dans les poids d'un réseau de neurones, contournant ainsi l'entraînement traditionnel. Cette approche pourrait fournir une vérité terrain pour la recherche en interprétabilité, car les modèles résultants ont des mécanismes internes connus.
Un compilateur traduit traditionnellement du code de haut niveau en instructions machine primitives adaptées à un matériel spécifique. En contraste, un nouveau paradigme traite les réseaux de neurones comme architecture cible : des programmes écrits dans un langage spécialisé comme RASP sont compilés directement en poids, de manière déterministe et sans entraînement. RASP, introduit en 2021 par Gail Weiss, Yoav Goldberg et Eran Yahav, propose deux constructions principales—select et aggregate—reflétant les mécanismes d'attention et de feed-forward des transformeurs. En 2023, DeepMind a mis en œuvre le compilateur Tracr, qui prend des programmes RASP et génère des poids de transformeur, utilisant le flux résiduel comme mémoire et allouant des segments disjoints pour les variables. Ces modèles compilés sont entièrement interprétables : l'emplacement de chaque variable et la fonction de chaque couche sont connus. La motivation principale est de créer des modèles de référence pour la recherche en interprétabilité, servant de normes d'étalonnage pour les outils d'analyse. Une découverte notable est que l'allocation directe des variables de Tracr est inefficace par rapport aux réseaux réels, qui superposent densément l'information, suggérant que les réseaux entraînés développent des représentations plus efficaces mais plus désordonnées.
Source: Habr — хаб ИИ —
original
