Мини-ПК на Strix Halo под параллельной нагрузкой: 236 tok/s на 32 одновременных запросах и три ошибки
Google/DeepMind
Beelink GTR9 Pro на Ryzen AI Max+ 395 показал 236 токенов в секунду суммарной генерации на 32 параллельных запросах в коротких прогонах и удержал средние 226 tok/s за 30 минут непрерывной нагрузки. В ходе тестирования обнаружен воспроизводимый провал пропускной способности при 8-10 клиентах, который не зависит от модели. Спекулятивный декодинг с MTP ускоряет один-два запроса, но при большем числе клиентов становится налогом.
Автор протестировал мини-ПК Beelink GTR9 Pro на APU Ryzen AI Max+ 395 (Strix Halo) с 128 ГБ LPDDR5X. Использовался рантайм llama.cpp через Vulkan/RADV. Лучший результат: Gemma 4 26B в кванте UD-Q4_K_XL выдала 236 tok/s на 32 одновременных запросах (медиана трёх прогонов по 75 секунд). За 30 минут непрерывной нагрузки средний агрегат составил 226,4 tok/s без тротлинга, при температуре 78 °C и
Показать ещё ↓
- Сокращения
- MTP = Multi-Token Prediction — многотокенное предсказание
- APU = Accelerated Processing Unit — ускоренный процессорный блок
- GPU = Graphics Processing Unit — графический процессор
- CPU = Central Processing Unit — центральный процессор
- MoE = Mixture of Experts — смесь экспертов
Источник: Habr — хаб NLP —
оригинал
