RechercheModèles 🇷🇺 28.07.2026 08:03

Comment les modèles intègrent les concepts dans des variétés : théorie, pratique et recherche de cercles

OpenAIOpenAI MistralMistral
Cet article explore la manière dont les modèles d'IA structurent géométriquement les concepts en variétés (par exemple, des cercles, des simplexes) dans leurs espaces d'activation. Il explique les fondements théoriques, y compris le théorème de plongement de Whitney, et démontre la détection empirique de représentations circulaires pour des concepts cycliques comme les jours de la semaine dans GPT-2 et Mistral 7B.
L'article explique que les modèles d'IA intègrent des concepts du monde réel dans des structures géométriques au sein de leurs espaces d'activation. Les concepts comme les oppositions binaires forment deux points isolés (dimension 0), les jours de la semaine forment un cercle (variété de dimension 1), et les hiérarchies forment des simplexes où la dimensionnalité ne s'applique pas. Le théorème de plongement de Whitney (1944) stipule que toute variété lisse de dimension d peut être plongée de manière lisse dans R^{2d}, ce qui donne une borne supérieure théorique sur les dimensions requises. Cependant, ce théorème ne limite pas directement les modèles en raison du plongement approximatif et de la superposition. Les variétés émergent lorsqu'un concept est ordonné en continu et que l'objectif d'entraînement du modèle exige des opérations sur cette structure. Des exemples pratiques incluent des représentations circulaires pour les jours de la semaine trouvées dans GPT-2 (couche 7) et Mistral 7B via le clustering SAE et l'analyse en composantes principales ; des interventions sur ces structures modifient le comportement du modèle.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches