InvestigaciónModelos 🇷🇺 28.07.2026 08:03

Cómo empaquetan los modelos los conceptos en variedades: teoría, práctica y la búsqueda de círculos

OpenAIOpenAI MistralMistral
El artículo explora cómo los modelos de IA estructuran geométricamente los conceptos en variedades (por ejemplo, círculos o simples) en sus espacios de activación. Explica los fundamentos teóricos, incluido el teorema de incrustación de Whitney, y demuestra la detección empírica de representaciones circulares para conceptos cíclicos como los días de la semana en GPT-2 y Mistral 7B.
El artículo explica que los modelos de IA empaquetan conceptos del mundo real en estructuras geométricas dentro de sus espacios de activación. Conceptos como las oposiciones binarias forman dos puntos aislados (de dimensión 0), los días de la semana forman un círculo (variedad de dimensión 1), y las jerarquías forman simplexes donde la dimensionalidad no es aplicable. El teorema de incrustación de Whitney (1944) establece que cualquier variedad lisa de dimensión d se puede incrustar suavemente en R^{2d}, lo que proporciona un límite superior teórico para las dimensiones requeridas. Sin embargo, el teorema no limita directamente a los modelos debido a la incrustación aproximada y la superposición. Las variedades emergen cuando un concepto está ordenado continuamente y el objetivo de entrenamiento del modelo requiere operaciones sobre esa estructura. Los ejemplos prácticos incluyen representaciones circulares para los días de la semana encontradas en GPT-2 (capa 7) y Mistral 7B mediante agrupamiento de SAE y PCA; las intervenciones en estas estructuras alteran el comportamiento del modelo.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas