Mini-pc op Strix Halo onder parallelle belasting: 236 tok/s bij 32 gelijktijdige verzoeken en drie fouten
Google/DeepMind
Een Beelink GTR9 Pro met Ryzen AI Max+ 395 behaalde 236 tok/s totaal bij 32 gelijktijdige verzoeken in korte runs, en hield een gemiddelde van 226 tok/s aan gedurende 30 minuten zonder throttling. De auteur ontdekte een reproduceerbare doorvoerdaling tussen 8 en 10 gelijktijdige clients bij alle geteste modellen, en vond dat speculatieve decodering (MTP) de prestaties bij enkele clients met 42% versnelde, maar een straf werd onder gelijktijdigheid.
Bij het testen van een Beelink GTR9 Pro (Ryzen AI Max+ 395, Radeon 8060S, 128 GB unified memory) met llama.cpp via Vulkan/RADV voerde de auteur parallelle inferentie-benchmarks uit. Qwen 3.6 35B-A3B in Q4_K_M vertoonde een doorvoerdal van 149 tok/s bij 8 clients tot 99 bij 10, herstellend naar 160 bij 32 clients. Dit dal was reproduceerbaar bij alle geteste modellen (Qwen in drie quantisaties en Gemma 4 26B in QAT) en kon niet aan één enkel model of quant worden toegeschreven. De beste totale doorvoer was 236 tok/s met Gemma 4 bij 32 clients (mediaan van runs van 75 seconden). Een uithoudingstest van 30 minuten leverde gemiddeld 226,4 tok/s met stabiele temperaturen (78°C) en vermogen (113 W), met 1,4% fouten door ontbrekende server-timings. Speculatieve decodering (MTP) verhoogde de snelheid van één client met 42% (53,3→75,6 tok/s), maar schaadde de gelijktijdigheid: bij 4 clients daalde het met 31%, bij 32 clients verloor het 33% doorvoer. De auteur merkt op dat er drie fouten waren die vóór publicatie werden ontdekt door controlemetingen.
Bron: Habr — хаб NLP —
origineel
