Hardware e Inferência 🇷🇺 03.08.2026 18:02

DeepSeek 0731 no DGX Spark: Overclock para 68 tok/s e por que o autor da ficha técnica obteve 57

DeepSeekDeepSeek NVIDIANVIDIA vLLMvLLM
Um desenvolvedor testa o desempenho do DeepSeek-V4-Flash em uma configuração com dois NVIDIA DGX Spark, medindo inicialmente 42,5 tok/s em comparação com os 57 tok/s declarados na ficha técnica do modelo. Após trocar a imagem de runtime do vLLM e habilitar explicitamente o backend MoE B12X, eles alcançaram 67,6 tok/s no perfil semelhante ao da ficha técnica, atribuindo as melhorias a mudanças específicas de configuração.
O autor implantou o DeepSeek-V4-Flash em dois nós DGX Spark conectados via QSFP 200G com RoCEv2, usando paralelismo tensorial entre nós. As medições iniciais mostraram 42,5 tok/s, cerca de 25% abaixo dos 57 tok/s declarados na ficha do modelo. Após testar várias hipóteses (temperatura, contabilização de prefill, comprimento de contexto), a principal diferença foi atribuída à imagem de runtime: mudar de um build baseado em vLLM 0.21.1 para um com vLLM 0.25.2 deu +22% no mesmo checkpoint, aumentando os tokens de saída por etapa de verificação de 3,27 para 4,80. Ganhos adicionais vieram da definição explícita de --moe-backend flashinfer_b12x, já que na imagem personalizada o B12X é excluído da seleção automática; isso adicionou +13,3% em média em um perfil semelhante ao de um cartão (59,7 para 67,6 tok/s). O autor também observa um novo lançamento de checkpoint (0731) com benchmarks de agente aprimorados e reconhece o trabalho paralelo de tonyd2wild em otimizações semelhantes.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas