Hardware & Inferentie 🇷🇺 03.08.2026 18:02

DeepSeek 0731 op DGX Spark: Overklokken naar 68 tok/s en waarom de kaartauteur 57 haalde

DeepSeekDeepSeek NVIDIANVIDIA vLLMvLLM
Een ontwikkelaar benchmarkt DeepSeek-V4-Flash op een dubbele NVIDIA DGX Spark-opstelling en meet aanvankelijk 42,5 tok/s ten opzichte van de 57 tok/s die op de modelkaart wordt geclaimd. Na het wisselen van de vLLM-runtime-image en het expliciet inschakelen van de B12X MoE-backend, behaalden ze 67,6 tok/s op het kaartachtige profiel, waarbij ze de verbeteringen toeschrijven aan specifieke configuratiewijzigingen.
De auteur implementeerde DeepSeek-V4-Flash op twee DGX Spark-nodes die via QSFP 200G met RoCEv2 zijn verbonden, met behulp van tensor-parallelisme over de nodes. Initiële metingen toonden 42,5 tok/s, ongeveer 25% onder de 57 tok/s die op de modelkaart wordt geclaimd. Na het testen van verschillende hypothesen (temperatuur, prefill-verwerking, contextlengte) werd het belangrijkste verschil toegeschreven aan de runtime-image: de overstap van een build op basis van vLLM 0.21.1 naar een met vLLM 0.25.2 leverde +22% op met dezelfde checkpoint, waardoor het aantal output-tokens per verificatiestap toenam van 3,27 naar 4,80. Verdere winst kwam door expliciet --moe-backend flashinfer_b12x in te stellen, omdat in de aangepaste image B12X is uitgesloten van automatische selectie; dit leverde gemiddeld +13,3% op met een kaartachtig profiel (59,7 tot 67,6 tok/s). De auteur merkt ook een nieuwe checkpoint-release (0731) op met verbeterde agent-benchmarks en erkent parallel werk van tonyd2wild aan vergelijkbare optimalisaties.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws