ModèlesRecherche 🇺🇸 27.07.2026 17:03

De DeepSeek V3 à V3.2 : architecture, attention sparse et mises à jour RL

DeepSeekDeepSeek
DeepSeek a publié son modèle phare V3.2 avec des poids ouverts, dont les performances sont comparables à celles de GPT-5 et Gemini 3.0 Pro. L'article détaille les changements architecturaux, notamment la nouvelle attention sparse DeepSeek (DSA), et l'évolution de V3 à travers R1 et V3.1 jusqu'au modèle hybride combinant raisonnement et chat standard.
DeepSeek a publié un nouveau modèle phare, V3.2, avec des poids ouverts, dont les performances rivalisent avec GPT-5 et Gemini 3.0 Pro. Ce modèle est hybride, c'est-à-dire qu'il permet de basculer entre les modes de raisonnement et de dialogue classique, contrairement au modèle de raisonnement dédié précédent, R1. V3.2 repose sur une amélioration architecturale : l'attention sparse DeepSeek (DSA), qui remplace la fenêtre glissante par un mécanisme de sélection des tokens précédents pertinents à l'aide d'un indexeur lightning et d'un sélecteur de tokens. DSA utilise des représentations compressées issues de l'attention latente multi-tête (MLA) pour calculer les scores de pertinence. La version précédente, V3.2-Exp, était une version expérimentale destinée au débogage de l'infrastructure. V3.1 est devenue un modèle hybride où les utilisateurs peuvent choisir le mode via un template de chat. R1-0528 est une mise à jour mineure de R1 avec des améliorations dans le post-entraînement. Dans l'ensemble, l'équipe DeepSeek est passée des modèles de raisonnement dédiés aux modèles hybrides, bien qu'il soit possible que des travaux sur R2 soient menés en parallèle. Il est également à noter que DeepSeek est repassée des puces Huawei à NVIDIA.
Source: Sebastian Raschka — original
Nos articles précédents sur ce sujet ↓
Infos fraîches