Do GPT-2 ao Kimi K3: escala cresce 22.580 vezes em sete anos, arquitetura principal constrói um "sistema operacional de memória"
Moonshot AI
A evolução técnica dos grandes modelos, do GPT-2 ao Kimi K3, mostra como a arquitetura de IA passa de "lembrar de tudo" para "memória seletiva". O KV Cache resolve a eficiência de geração, a Atenção Linear explora memória de longo prazo mais eficiente, e DeltaNet e Kimi Linear permitem que os modelos aprendam a atualizar, esquecer e gerenciar informações. O Kimi K3 tem 2,8 trilhões de parâmetros, o equivalente a cerca de 22.580 modelos GPT-2.
O artigo traça sete anos de evolução arquitetural, analisando as mudanças técnicas por trás do crescimento em escala dos grandes modelos e como o Kimi K3 rompe as limitações tradicionais do Transformer com novos mecanismos de memória. O GPT-2 utilizava uma arquitetura apenas com decodificador, com embeddings de token e posição. O KV Cache armazena vetores chave-valor para evitar recálculos. A Atenção Linear aplica mapas de características (por exemplo, ELU+1) a q e k, comprimindo vetores KV em uma matriz de estado de tamanho fixo. O DeltaNet estende a Atenção Linear com uma regra delta para atualizar seletivamente a memória, reduzindo a interferência de informações. O Gated DeltaNet combina a passagem de portas do Mamba com a regra delta, adicionando um parâmetro de decaimento α. O Kimi Linear melhora o Gated DeltaNet com passagem de portas de granulação fina por canal. A espinha dorsal linguística do Kimi K3 possui 23 macroloops, cada um contendo três camadas de Atenção Kimi Delta e uma camada de Atenção Latente Multi-Cabeça. Ele usa FFN denso na primeira camada e MoE Latente em todas as outras. O Kimi K3 tem 898 especialistas no total; dois especialistas compartilhados processam cada token, e o roteador seleciona 16 especialistas por token dos 896 restantes.
Fonte: InfoQ 中国 —
original
