Hardware e InferenciaCódigo Abierto 🇷🇺 24.07.2026 10:04

Mini-PC con Strix Halo bajo carga paralela: 236 tok/s en 32 solicitudes concurrentes y tres errores

Google/DeepMindGoogle/DeepMind
Un Beelink GTR9 Pro con Ryzen AI Max+ 395 alcanzó 236 tok/s agregados en 32 solicitudes concurrentes en ejecuciones cortas, manteniendo un promedio de 226 tok/s durante 30 minutos sin estrangulamiento térmico. El autor descubrió una caída reproducible en el rendimiento entre 8 y 10 clientes concurrentes en todos los modelos probados, y encontró que la decodificación especulativa (MTP) aceleró el rendimiento de un solo cliente en un 42%, pero se convirtió en una penalización bajo concurrencia.
Al probar una Beelink GTR9 Pro (Ryzen AI Max+ 395, Radeon 8060S, 128 GB de memoria unificada) con llama.cpp a través de Vulkan/RADV, el autor ejecutó pruebas comparativas de inferencia en paralelo. El modelo Qwen 3.6 35B-A3B en cuantización Q4_K_M mostró un valle de rendimiento de 149 tokens por segundo con 8 clientes hasta 99 con 10, recuperándose hasta 160 con 32 clientes. Este valle fue reproducible en todos los modelos probados (Qwen en tres cuantizaciones y Gemma 4 26B en QAT) y no pudo atribuirse a un único modelo o cuantización. El mejor rendimiento agregado fue de 236 tokens por segundo con Gemma 4 y 32 clientes (mediana de ejecuciones de 75 segundos). Una prueba de resistencia de 30 minutos promedió 226.4 tokens por segundo con temperaturas (78 °C) y consumo (113 W) estables, con un 1.4 % de errores debido a tiempos de servidor faltantes. La decodificación especulativa (MTP) aumentó la velocidad para un solo cliente en un 42 % (de 53.3 a 75.6 tokens por segundo), pero perjudicó la concurrencia: con 4 clientes retrocedió un 31 % y con 32 clientes perdió un 33 % de rendimiento. El autor señala tres errores detectados antes de la publicación mediante mediciones de control.
Fuente: Habr — хаб NLP — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas