⚡ EN DIRECT
De DeepSeek V3 à V3.2 : architecture, attention sparse et améliorations par apprentissage par renforcement
DeepSeek
DeepSeek a publié V3.2, un modèle vedette à poids ouverts avec des performances comparables à GPT-5 et Gemini 3.0 Pro. Le modèle introduit l'Attention Sparse DeepSeek (DSA) pour l'efficacité, et évolue d'un modèle de raisonnement dédié (R1) à un modèle de raisonnement hybride (V3.1, V3.2). La chronologie inclut V3, R1, R1-0528, V3.1, V3.2-Exp et V3.2, avec des points forts architecturaux comme l'Attention Latente Multi-Têtes (MLA) et l'entraînement RLVR.
DeepSeek V3.2, publié pendant un week-end de fête aux États-Unis, égalise les performances de GPT-5 et Gemini 3.0 Pro tout en étant open-weight. Il s'appuie sur V3.1, qui avait ajouté un raisonnement hybride (modes instruction et raisonnement) à la base V3. La principale nouveauté est le DeepSeek Sparse Attention (DSA), un mécanisme d'attention sparse apprise avec un indexeur éclair et un sélecteur de jetons qui améliore l'efficacité, notamment pour les longs contextes. Le DSA remplace l'attention à fenêtre glissante en sélectionnant dynamiquement les jetons passés auxquels prêter attention. V3.2-Exp (septembre 2025) était une version expérimentale pour préparer l'infrastructure de V3.2. Modèles précédents : V3 (décembre 2024) utilisait MoE et MLA ; R1 (janvier 2025) ajoutait le raisonnement via RLVR avec GRPO ; R1-0528 était une mise à niveau mineure. L'entreprise est apparemment passée des puces NVIDIA à Huawei, puis de nouveau à NVIDIA. La version V3.2 vise un modèle hybride polyvalent, tandis qu'un R2 dédié pourrait encore être en développement.
Source: Sebastian Raschka —
original
