RechercheModèles 🇺🇸 27.07.2026 13:06

Dernières innovations dans les architectures de LLM : caches KV partagés, embeddings par couche et attention compressée

Google/DeepMindGoogle/DeepMind PoolsidePoolside DeepSeekDeepSeek Technology Innovation InstituteTechnology Innovation Institute
Les nouveaux LLM open source se concentrent de plus en plus sur un traitement efficace des longs contextes. Gemma 4 (Google) utilise le partage des tenseurs KV entre les couches pour réduire la taille du cache, ainsi que des embeddings par couche pour améliorer l'efficacité paramétrique. Laguna XS.2 (Poolside) emploie une budgétisation de l'attention par couche, et DeepSeek V4 introduit les mécanismes mHC et d'attention compressée.
Cet article examine les récentes évolutions architecturales des LLM open source visant à réduire les coûts lors du traitement de longs contextes. Les modèles Gemma 4 de Google (E2B, E4B) utilisent un cache KV partagé : les couches ultérieures réutilisent les clés et valeurs des couches précédentes du même type d'attention, ce qui réduit de moitié la taille du cache KV (par exemple, pour E2B avec un contexte de 128K, l'économie est de 2,7 Go en bfloat16). De plus, les variantes E2B et E4B emploient des embeddings par couche (per-layer embeddings, PLE) : chaque bloc Transformer reçoit un petit vecteur spécifique au jeton provenant d'une table « compressée » commune, ce qui augmente la capacité du modèle sans augmenter proportionnellement le nombre de paramètres dans les blocs principaux. Le modèle Laguna XS.2 de Poolside met en œuvre un budget d'attention par couche : sur 40 couches, seules 10 disposent d'une attention globale complète, tandis que les 30 autres utilisent une fenêtre glissante (512 jetons), permettant ainsi des économies de ressources. Enfin, DeepSeek V4 utilise des mécanismes de compression multi-têtes (multi-head compression, mHC) et d'attention compressée pour une optimisation supplémentaire. Bien que ces techniques puissent sembler être de simples ajustements, elles réduisent considérablement la charge mémoire et de calcul lors du traitement de longues séquences.
Source: Sebastian Raschka — original
Nos articles précédents sur ce sujet ↓
Infos fraîches