하드웨어 및 추론오픈 소스 🇷🇺 24.07.2026 10:04

Strix Halo 기반 미니 PC, 병렬 부하에서 32개 동시 요청에 236 tok/s 및 세 가지 오류

Google/DeepMindGoogle/DeepMind
Beelink GTR9 Pro (Ryzen AI Max+ 395 탑재)가 짧은 실행에서 32개 동시 요청에 대해 총 236 tok/s를 달성했으며, 30분 동안 스로틀링 없이 평균 226 tok/s를 유지했습니다. 저자는 모든 테스트 모델에서 8~10개 동시 클라이언트 사이에 재현 가능한 처리량 저하를 발견했으며, 추측적 디코딩(MTP)이 단일 클라이언트 성능을 42% 향상시켰지만 동시성에서는 오히려 패널티가 된다는 사실을 발견했습니다.
Beelink GTR9 Pro (Ryzen AI Max+ 395, Radeon 8060S, 128GB 통합 메모리)를 Vulkan/RADV를 통해 llama.cpp로 테스트하면서, 저자는 병렬 추론 벤치마크를 실행했습니다. Qwen 3.6 35B-A3B를 Q4_K_M 양자화로 실행했을 때, 처리량이 클라이언트 8개에서 149tok/s에서 10개에서 99tok/s로 떨어졌다가 32개에서 160tok/s로 회복되는 골짜기가 나타났습니다. 이 골짜기는 테스트한 모든 모델(Qwen의 세 가지 양자화와 QAT 양자화된 Gemma 4 26B)에서 재현 가능했으며, 단일 모델이나 양자화에 기인한 것이 아니었습니다. 최고 총합 처리량은 Gemma 4에서 클라이언트 32개(75초 실행 중앙값)로 236tok/s였습니다. 30분 내구성 테스트에서는 평균 226.4tok/s, 안정적인 온도(78°C)와 전력(113W)을 보였으며, 서버 타이밍 누락으로 인한 오류율은 1.4%였습니다. 추측 디코딩(MTP, Multi-Token Prediction)은 단일 클라이언트 속도를 42% 향상시켰지만(53.3→75.6tok/s), 동시성에는 악영향을 미쳐 클라이언트 4개에서는 31% 퇴보했고, 32개에서는 33% 처리량이 감소했습니다. 저자는 대조 측정을 통해 발표 전에 발견된 세 가지 실수를 언급했습니다.
출처: Habr — хаб NLP — 원문
관련 게시물 ↓
새로운 뉴스