Mini-PC Strix Halo -rinnakkaiskuormalla: 236 tok/s 32 samanaikaisella pyynnöllä ja kolme virhettä
Google/DeepMind
Beelink GTR9 Pro -tietokone Ryzen AI Max+ 395 -prosessorilla saavutti 236 tok/s:n yhteissuorituskyvyn 32 samanaikaisella pyynnöllä lyhyissä ajoissa ja ylläpiti 226 tok/s:n keskiarvoa 30 minuutin ajan ilman kuristusta. Kirjoittaja havaitsi toistettavan suorituskyvyn laskun 8 ja 10 samanaikaisen asiakkaan välillä kaikilla testatuilla malleilla ja totesi, että spekulatiivinen dekoodaus (MTP) nopeutti yksittäisasiakkaan suorituskykyä 42 %, mutta muuttui rangaistukseksi rinnakkaiskuormalla.
Testatessaan Beelink GTR9 Pro -laitetta (Ryzen AI Max+ 395, Radeon 8060S, 128 Gt yhtenäistä muistia) llama.cpp:llä Vulkan/RADV:n kautta, kirjoittaja suoritti rinnakkaisen päättelyn vertailuarvoja. Qwen 3.6 35B-A3B Q4_K_M-muodossa osoitti läpimenolaakson 149 tokenia sekunnissa kahdeksalla asiakkaalla laskien 99:ään kymmenellä, noustakseen 160:een 32 asiakkaalla. Tämä laakso oli toistettavissa kaikilla testatuilla malleilla (Qwen kolmessa kvantisoinnissa ja Gemma 4 26B QAT-muodossa), eikä sitä voitu yhdistää yksittäiseen malliin tai kvantisointiin. Paras kokonaissuoritus oli 236 tokenia sekunnissa Gemma 4:llä 32 asiakkaalla (75 sekunnin ajojen mediaani). 30 minuutin kestävyystesti tuotti keskimäärin 226,4 tokenia sekunnissa vakaissa lämpötiloissa (78°C) ja tehonkulutuksessa (113 W), ja virheitä oli 1,4 prosenttia puuttuvien palvelimen aikaleimojen takia. Spekulatiivinen dekoodaus (MTP) paransi yhden asiakkaan nopeutta 42 prosenttia (53,3→75,6 tok/s), mutta heikensi samanaikaisuutta: neljällä asiakkaalla läpimeno laski 31 prosenttia, 32 asiakkaalla 33 prosenttia. Kirjoittaja huomauttaa kolmesta virheestä, jotka kontrollimittaukset paljastivat ennen julkaisua.
Lähde: Habr — хаб NLP —
Alkuperäinen
