Мини-ПК на Strix Halo под параллельной нагрузкой: 236 токенов/с на 32 одновременных запросах и три ошибки
Google/DeepMind
Beelink GTR9 Pro с Ryzen AI Max+ 395 достиг 236 токенов/с в сумме на 32 одновременных запросах в коротких прогонах, поддерживая среднюю скорость 226 токенов/с в течение 30 минут без троттлинга. Автор обнаружил воспроизводимое падение пропускной способности между 8 и 10 одновременными клиентами на всех протестированных моделях, а также выяснил, что спекулятивное декодирование (MTP) ускоряет производительность одного клиента на 42%, но становится помехой при параллельной работе.
Тестируя Beelink GTR9 Pro (Ryzen AI Max+ 395, Radeon 8060S, 128 ГБ унифицированной памяти) с llama.cpp через Vulkan/RADV, автор провёл бенчмарки параллельного инференса. Qwen 3.6 35B-A3B в квантизации Q4_K_M показал провал пропускной способности: со 149 токенов/с при 8 клиентах до 99 на 10 с восстановлением до 160 на 32 клиентах. Этот провал воспроизводился на всех протестированных моделях (Qwen
Показать ещё ↓
Источник: Habr — хаб NLP —
оригинал
