Hardware e Inferencia 🇷🇺 03.08.2026 18:02

DeepSeek 0731 en DGX Spark: Overclocking a 68 tok/s y por qué el autor de la tarjeta obtuvo 57

DeepSeekDeepSeek NVIDIANVIDIA vLLMvLLM
Un desarrollador evalúa DeepSeek-V4-Flash en una configuración dual de NVIDIA DGX Spark, midiendo inicialmente 42,5 tok/s frente a los 57 tok/s que se afirman en la tarjeta del modelo. Después de cambiar la imagen de ejecución de vLLM y habilitar explícitamente el backend MoE B12X, lograron 67,6 tok/s en el perfil tipo tarjeta, atribuyendo las mejoras a cambios de configuración específicos.
El autor desplegó DeepSeek-V4-Flash en dos nodos DGX Spark conectados mediante QSFP 200G con RoCEv2, utilizando paralelismo tensorial entre nodos. Las mediciones iniciales mostraron 42,5 tok/s, aproximadamente un 25% por debajo de los 57 tok/s declarados en la tarjeta del modelo. Tras probar varias hipótesis (temperatura, contabilización del prefill, longitud del contexto), la diferencia principal se atribuyó a la imagen de ejecución: cambiar de una compilación basada en vLLM 0.21.1 a una con vLLM 0.25.2 proporcionó un +22% en el mismo punto de control, aumentando los tokens de salida por paso de verificación de 3,27 a 4,80. Otras mejoras provinieron de configurar explícitamente --moe-backend flashinfer_b12x, ya que en la imagen personalizada B12X se excluye de la auto-selección; esto añadió un +13,3% en promedio en un perfil similar al de una tarjeta (de 59,7 a 67,6 tok/s). El autor también señala una nueva versión del punto de control (0731) con mejores benchmarks de agentes, y reconoce el trabajo paralelo de tonyd2wild en optimizaciones similares.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas