Mini-PC com Strix Halo sob carga paralela: 236 tok/s em 32 requisições concorrentes e três erros
Google/DeepMind
Um Beelink GTR9 Pro com Ryzen AI Max+ 395 atingiu 236 tok/s agregados em 32 requisições concorrentes em testes curtos, mantendo uma média de 226 tok/s ao longo de 30 minutos sem redução de desempenho. O autor descobriu uma queda de throughput reproduzível entre 8 e 10 clientes concorrentes em todos os modelos testados, e constatou que a decodificação especulativa (MTP) acelerou o desempenho de cliente único em 42%, mas tornou-se uma penalidade sob concorrência.
Testando um Beelink GTR9 Pro (Ryzen AI Max+ 395, Radeon 8060S, 128 GB de memória unificada) com llama.cpp via Vulkan/RADV, o autor realizou benchmarks de inferência paralela. O Qwen 3.6 35B-A3B em Q4_K_M apresentou um vale de throughput de 149 tok/s com 8 clientes para 99 com 10, recuperando para 160 com 32 clientes. Esse vale foi reproduzível em todos os modelos testados (Qwen em três quantizações e Gemma 4 26B em Quantização Adaptativa por Treinamento), não podendo ser atribuído a um único modelo ou quantização. O melhor agregado foi de 236 tok/s com Gemma 4 em 32 clientes (mediana de execuções de 75 segundos). Um teste de resistência de 30 minutos obteve média de 226,4 tok/s com temperaturas estáveis (78°C) e potência (113 W), com 1,4% de erros devido a temporizações ausentes do servidor. A decodificação especulativa (Modelo de Predição de Tokens) aumentou a velocidade de cliente único em 42% (53,3→75,6 tok/s), mas prejudicou a concorrência: com 4 clientes houve regressão de 31%, com 32 clientes houve perda de 33% no throughput. O autor observa três erros detectados antes da publicação por medições de controle.
Fonte: Habr — хаб NLP —
original
