Laitteisto ja päättely 🇷🇺 03.08.2026 18:02

DeepSeek 0731 DGX Spark -alustalla: Ylikellotus 68 tok/s:n nopeuteen ja miksi kortin tekijä sai 57

DeepSeekDeepSeek NVIDIANVIDIA vLLMvLLM
Kehittäjä vertailee DeepSeek-V4-Flash -mallia kahden NVIDIA DGX Spark -järjestelmän kokoonpanossa ja mittaa aluksi 42,5 tok/s, kun mallikortti lupaa 57 tok/s. Vaihtamalla vLLM -runtime-kuvan ja ottamalla nimenomaisesti käyttöön B12X MoE -taustajärjestelmän, he saavuttivat 67,6 tok/s kortin kaltaisella profiililla, ja parannukset johtuvat tietyistä kokoonpanomuutoksista.
Kirjoittaja otti käyttöön DeepSeek-V4-Flashin kahdella DGX Spark -solmulla, jotka on yhdistetty QSFP 200G:llä RoCEv2:n avulla, käyttäen tensoririnnakkaisuutta solmujen välillä. Alkuperäiset mittaukset osoittivat 42,5 tokenia sekunnissa, mikä on noin 25 prosenttia alle mallikortissa ilmoitetun 57 tokenin sekunnissa. Testattuaan useita hypoteeseja (lämpötila, etuliitteen huomiointi, kontekstin pituus), suurin ero johtui ajonaikaisesta kuvasta: vaihto vLLM 0.21.1 -pohjaisesta rakennuksesta vLLM 0.25.2:ta käyttävään rakennukseen antoi +22 prosenttia samalla tarkistuspisteellä, mikä lisäsi vahvistusvaiheen tulostustokeneita 3,27:stä 4,80:aan. Lisähyötyjä saatiin asettamalla nimenomaisesti --moe-backend flashinfer_b12x, koska mukautetussa kuvassa B12X on suljettu pois automaattisesta valinnasta; tämä lisäsi keskimäärin +13,3 prosenttia korttimaisen profiilin mukaan (59,7:stä 67,6 tokeniin sekunnissa). Kirjoittaja mainitsee myös uuden tarkistuspisteen julkaisun (0731), jossa on parannettuja agenttivertailuarvoja, ja tunnustaa tonyd2wildin samankaltaisiin optimointeihin liittyvän rinnakkaistyön.
Lähde: Habr — хаб ИИ — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset