Matériel et InférenceOpen Source 🇷🇺 24.07.2026 10:04

Mini-PC sur Strix Halo en charge parallèle : 236 tok/s sur 32 requêtes simultanées et trois erreurs

Google/DeepMindGoogle/DeepMind
Un Beelink GTR9 Pro avec Ryzen AI Max+ 395 a atteint un débit agrégé de 236 tok/s sur 32 requêtes simultanées lors de brèves exécutions, maintenant une moyenne de 226 tok/s pendant 30 minutes sans throttling. L'auteur a découvert une baisse de débit reproductible entre 8 et 10 clients simultanés, tous modèles confondus, et a constaté que le décodage spéculatif (MTP) accélérait les performances mono-client de 42 %, mais devenait une pénalité en situation de concurrence.
En testant un Beelink GTR9 Pro (Ryzen AI Max+ 395, Radeon 8060S, 128 Go de mémoire unifiée) avec llama.cpp via Vulkan/RADV, l'auteur a réalisé des benchmarks d'inférence parallèle. Qwen 3.6 35B-A3B en Q4_K_M a montré un creux de débit passant de 149 tok/s avec 8 clients à 99 avec 10, avant de remonter à 160 avec 32 clients. Ce creux était reproductible sur tous les modèles testés (Qwen en trois quantifications et Gemma 4 26B en QAT) et n'a pu être attribué à un seul modèle ou quantification. Le meilleur débit agrégé était de 236 tok/s avec Gemma 4 et 32 clients (médiane de runs de 75 secondes). Un test d'endurance de 30 minutes a donné une moyenne de 226,4 tok/s avec des températures (78°C) et une puissance (113 W) stables, avec 1,4 % d'erreurs dues à des horodatages manquants du serveur. Le décodage spéculatif (MTP) a amélioré la vitesse monoclients de 42 % (53,3→75,6 tok/s) mais a nui à la concurrence : avec 4 clients, il a régressé de 31 %, avec 32 clients, il a perdu 33 % de débit. L'auteur note trois erreurs détectées avant publication grâce à des mesures de contrôle.
Source: Habr — хаб NLP — original
Nos articles précédents sur ce sujet ↓
Infos fraîches