DeepSeek 0731 sur DGX Spark : overclocking à 68 tok/s et pourquoi l'auteur de la fiche a obtenu 57
DeepSeek
NVIDIA
vLLM
Un développeur évalue DeepSeek-V4-Flash sur une configuration double NVIDIA DGX Spark, mesurant initialement 42,5 tok/s par rapport aux 57 tok/s annoncés sur la fiche du modèle. Après avoir changé l'image d'exécution vLLM et activé explicitement le backend MoE B12X, ils ont atteint 67,6 tok/s sur le profil type de la fiche, attribuant ces améliorations à des modifications de configuration spécifiques.
L'auteur a déployé DeepSeek-V4-Flash sur deux nœuds DGX Spark reliés par QSFP 200G avec RoCEv2, en utilisant le parallélisme tensoriel entre les nœuds. Les mesures initiales ont montré 42,5 tok/s, soit environ 25 % de moins que les 57 tok/s annoncés sur la fiche du modèle. Après avoir testé plusieurs hypothèses (température, prise en compte du préremplissage, longueur du contexte), la principale différence a été attribuée à l'image d'exécution : le passage d'une version basée sur vLLM 0.21.1 à une version avec vLLM 0.25.2 a donné +22 % sur le même point de contrôle, augmentant les jetons de sortie par étape de vérification de 3,27 à 4,80. Des gains supplémentaires sont venus de la définition explicite de --moe-backend flashinfer_b12x, car dans l'image personnalisée, B12X est exclu de la sélection automatique ; cela a ajouté +13,3 % en moyenne sur un profil de type carte (59,7 à 67,6 tok/s). L'auteur note également une nouvelle version du point de contrôle (0731) avec des benchmarks d'agents améliorés, et reconnaît le travail parallèle de tonyd2wild sur des optimisations similaires.
Source: Habr — хаб ИИ —
original
