Strix Halo搭載ミニPC、並列負荷下で236tok/s、32同時リクエストでエラー3件

Google/DeepMindGoogle/DeepMind
Beelink GTR9 Pro(Ryzen AI Max+ 395搭載)は、32同時リクエストの短時間実行で236tok/sの総合スループットを記録し、30分間の平均226tok/sをスロットリングなしで維持しました。著者は、全テストモデルで8~10同時クライアント間で再現可能なスループット低下を発見し、投機的デコード(MTP)はシングルクライアント性能を42%向上させる一方、並列時にはペナルティとなることを明らかにしました。
Beelink GTR9 Pro(Ryzen AI Max+ 395、Radeon 8060S、128GBユニファイドメモリ)をVulkan/RADV経由でllama.cppを用いてテストした著者は、並列推論ベンチマークを実施した。Qwen 3.6 35B-A3BのQ4_K_Mでは、スループットが8クライアント時の149トークン/秒から10クライアント時の99トークン/秒に低下する谷間が見られ、32クライアント時には160トークン/秒に回復した。この谷間はテストしたすべてのモデル(3種類の量子化におけるQwenとQATにおけるGemma 4 26B)で再現可能であり、単一のモデルや量子化に起因するものではなかった。最高の総合スループットは、32クライアント時のGemma 4で236トークン/秒(75秒の実行の中央値)でした。30分間の耐久テストでは、平均226.4トークン/秒、安定した温度(78℃)と電力(113W)を示し、サーバーのタイミング欠落によるエラーは1.4%でした。投機的デコード(MTP)によりシングルクライアントの速度は42%向上(53.3→75.6トークン/秒)しましたが、同時実行性には悪影響を与え、4クライアント時には31%低下、32クライアント時には33%のスループット低下となりました。著者は、制御測定により公表前に発見された3つのミスについて言及しています。
出典: Habr — хаб NLP — 原文
関連記事 ↓
新着ニュース