Мини-ПК на Strix Halo под параллельной нагрузкой: 236 tok/s на 32 одновременных запросах и три ошибки
Beelink GTR9 Pro на Ryzen AI Max+ 395 показал 236 токенов в секунду суммарной генерации на 32 параллельных запросах в коротких прогонах и удержал средние 226 tok/s за 30 минут непрерывной нагрузки. В ходе тестирования обнаружен воспроизводимый провал пропускной способности при 8-10 клиентах, который не зависит от модели. Спекулятивный декодинг с MTP ускоряет один-два запроса, но при большем числе клиентов становится налогом.
Google/DeepMind
Habr — хаб NLP24.07 · 10:04

