Donanım ve ÇıkarımAçık Kaynak 🇷🇺 24.07.2026 10:04

Strix Halo tabanlı Mini-PC paralel yük altında: 32 eşzamanlı istekte 236 tok/s ve üç hata

Google/DeepMindGoogle/DeepMind
Ryzen AI Max+ 395 işlemcili bir Beelink GTR9 Pro, kısa çalışmalarda 32 eşzamanlı istekte toplam 236 tok/s hıza ulaştı ve 30 dakika boyunca ortalama 226 tok/s hızını kısıtlama olmaksızın sürdürdü. Yazar, test edilen tüm modellerde 8 ile 10 eşzamanlı istemci arasında tekrarlanabilir bir verim düşüşü keşfetti ve spekülatif kod çözmenin (MTP) tek istemcili performansı %42 artırdığını ancak eşzamanlılık altında bir cezaya dönüştüğünü buldu.
Beelink GTR9 Pro (Ryzen AI Max+ 395, Radeon 8060S, 128 GB birleşik bellek) ile llama.cpp'yi Vulkan/RADV üzerinden test eden yazar, paralel çıkarım kıyaslamaları yaptı. Qwen 3.6 35B-A3B'yi Q4_K_M formatında çalıştırırken, 8 istemcide 149 tok/s'den 10 istemcide 99 tok/s'ye düşen bir verim vadisi gözlemlendi; 32 istemcide ise 160 tok/s'ye toparlandı. Bu vadi, test edilen tüm modellerde (üç farklı nicelemede Qwen ve QAT formatında Gemma 4 26B) tekrarlanabildi ve tek bir modele veya nicelemeye atfedilemedi. En iyi toplam değer, 32 istemcide Gemma 4 ile 236 tok/s oldu (75 saniyelik çalıştırmaların medyanı). 30 dakikalık dayanıklılık testinde ortalama 226,4 tok/s, kararlı sıcaklık (78°C) ve güç (113 W) elde edilirken, eksik sunucu zamanlamalarından kaynaklanan %1,4 hata oranı oluştu. Spekülatif kod çözme (MTP), tek istemci hızını %42 artırdı (53,3→75,6 tok/s) ancak eşzamanlılığı olumsuz etkiledi: 4 istemcide %31 geriledi, 32 istemcide ise %33 verim kaybı yaşandı. Yazar, kontrol ölçümleriyle yayımdan önce yakalanan üç hatayı belirtiyor.
Kaynak: Habr — хаб NLP — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler