ModèlesAgents 🇺🇸 01.08.2026 02:01

DeepSeek améliore V4-Flash-0731 : des gains majeurs en codage agentique et en version bêta de l'API

DeepSeekDeepSeek AnthropicAnthropic
DeepSeek a publié DeepSeek-V4-Flash-0731, une mise à niveau officielle de son aperçu, avec des améliorations significatives dans les benchmarks de codage agentique. Le modèle conserve la même architecture mais bénéficie d'un re-post-entraînement, et l'API est désormais en version bêta publique avec prise en charge du format API Responses et de l'adaptation Codex. Les poids sont sous licence MIT et non restreints, ce qui permet de larges options de déploiement.
DeepSeek a publié DeepSeek-V4-Flash-0731 sur Hugging Face et a fait passer l'API officielle V4-Flash en bêta publique le 31 juillet 2026. La fiche du modèle indique qu'il s'agit de la version officielle remplaçant l'aperçu, avec une architecture et une taille inchangées ; les gains proviennent d'un ré-entraînement postérieur. Le point de contrôle inclut le module de décodage spéculatif DSpark, et Hugging Face rapporte 304 milliards de paramètres, y compris le module draft en plus des 284 milliards de la base. L'API prend désormais en charge nativement le format Responses API et est adaptée pour Codex, mais l'API V4-Pro et les modèles d'application/web n'ont pas été mis à jour. Le déploiement est possible via l'API à un coût réduit (environ un tiers du prix de sortie pro) ou via un auto-hébergement, ce qui nécessite des ressources importantes : les poids sont sous licence MIT, mais chaque expert reste en mémoire. Un exemple vLLM le sert sur un nœud 4×GB300 ; les GGUFs dynamiques d'Unsloth tiennent dans environ 110 Go de mémoire à quantification agressive. L'architecture comprend 284 milliards de paramètres avec 13 milliards actifs par jeton, un contexte de 1 million de jetons, une attention hybride avec CSA et HCA, et des hyper-connexions contraintes par une variété. Les benchmarks montrent que V4-Flash-0731 surpasse V4-Pro (Aperçu) sur tous les benchmarks agentiques, mais tous les chiffres sont rapportés par DeepSeek sur un harnais non publié. DSpark est activé avec un drapeau vLLM, et le modèle utilise un dossier d'encodage au lieu d'un modèle de conversation Jinja.
Source: MarkTechPost — original
Nos articles précédents sur ce sujet ↓
Infos fraîches