⚡ EN DIRECT
RechercheModèles 🇺🇸 27.07.2026 13:06

Innovations dans l'architecture des LLM : partage KV, embeddings par couche et attention compressée

Google/DeepMindGoogle/DeepMind PoolsidePoolside DeepSeekDeepSeek Technology Innovation InstituteTechnology Innovation Institute
Sebastian Raschka passe en revue les récentes avancées en architecture de LLM open-weight, en se concentrant sur l'efficacité des longs contextes. Les techniques clés incluent le partage KV entre couches (Gemma 4), les embeddings par couche (Gemma 4 E2B/E4B), la budgétisation de l'attention par couche (Laguna XS.2), l'attention convolutive compressée (ZAYA1) et mHC avec attention compressée (DeepSeek V4). Celles-ci réduisent la taille du cache KV et le trafic mémoire pour les workflows de raisonnement et d'agents.
Sebastian Raschka passe en revue les récentes modifications d'architecture des modèles open-weight LLM visant à réduire les coûts des longs contextes. Dans Gemma 4 E2B/E4B, les dernières couches réutilisent les états de clé-valeur des couches précédentes (attention inter-couches), ce qui permet d'économiser environ la moitié de la taille du cache KV (par exemple, 2,7 Go pour un contexte de 128K). De plus, ces modèles utilisent des plongements par couche (PLE) pour augmenter la capacité sans étendre la pile principale du transformateur — le nombre effectif de paramètres est inférieur au total incluant les plongements. Laguna XS.2 de Poolside fait varier le coût de l'attention par couche, avec 30 couches à fenêtre glissante (fenêtre de 512) et 10 couches d'attention complète. ZAYA1-8B introduit une attention convolutive compressée, et DeepSeek V4 utilise mHC et attention compressée. Ces ajustements sont motivés par le besoin croissant de traitement efficace des longs contextes dans les modèles de raisonnement et les workflows d'agents.
Source: Sebastian Raschka — original
Nos articles précédents sur ce sujet ↓
Infos fraîches