ModelosInvestigación 🇨🇳 30.07.2026 13:02

De GPT-2 a Kimi K3: la escala crece 22.580 veces en siete años, el hilo arquitectónico principal construye un "sistema operativo de memoria"

Moonshot AIMoonshot AI
La evolución técnica de los modelos grandes desde GPT-2 hasta Kimi K3 muestra cómo la arquitectura de inteligencia artificial pasa de "recordarlo todo" a "memoria selectiva". La caché KV resuelve la eficiencia de generación, la Atención Lineal explora una memoria a largo plazo más eficiente, y DeltaNet y Kimi Lineal permiten que los modelos aprendan a actualizar, olvidar y gestionar información. Kimi K3 tiene 2,8 billones de parámetros, equivalentes a unos 22.580 modelos GPT-2.
El artículo recorre siete años de evolución arquitectónica, analizando los cambios técnicos detrás del crecimiento en escala de los modelos grandes y cómo Kimi K3 supera las limitaciones tradicionales de los Transformers con nuevos mecanismos de memoria. GPT-2 utilizaba una arquitectura solo de decodificador con embeddings de token y posición. KV Cache almacena los vectores clave-valor para evitar recálculos. Linear Attention aplica mapas de características (por ejemplo, ELU+1) a q y k, comprimiendo los vectores KV en una matriz de estado de tamaño fijo. DeltaNet extiende Linear Attention con una regla delta para actualizar selectivamente la memoria, reduciendo la interferencia de información. Gated DeltaNet combina el gating de Mamba con la regla delta, añadiendo un parámetro de decaimiento α. Kimi Linear mejora Gated DeltaNet con una compuerta más fina a nivel de canal. El backbone lingüístico de Kimi K3 tiene 23 macrobucles, cada uno contiene tres capas Kimi Delta Attention y una capa Multi-Head Latent Attention. Utiliza FFN densa en la primera capa y Latent MoE en todas las demás. Kimi K3 tiene 898 expertos en total; dos expertos compartidos procesan cada token, y el enrutador selecciona 16 expertos por token de los 896 restantes.
Fuente: InfoQ 中国 — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas