Mac mini M4 Gerçek Dünya Saniyedeki Token Sayısı: Kıyaslama Sonuçları
Apple
Meta
Mistral
Alibaba/Qwen
DeepSeek
Bir Mac kiralama hizmeti sahibi, Mac mini M4 (16GB) üzerinde tutarlı bir metodoloji kullanarak altı büyük dil modelini (LLM) kıyasladı ve üretim hızının belleğe bağlı olduğunu ve model boyutuyla ters orantılı olarak ölçeklendiğini buldu. Llama 3.2 3B saniyede 46,7 token (tok/s) elde ederken, Qwen 2.5 14B sadece 11,7 tok/s yönetebildi; istem işleme 10-20 kat daha hızlıydı. Pratik tavsiye: 8B modeller 16GB üzerinde rahatça çalışırken, daha büyük modeller daha fazla belleğe ihtiyaç duyar.
Bir Mac kiralama servisi sahibi, 16GB birleşik belleğe ve 120 GB/s bant genişliğine sahip Mac mini M4 üzerinde Ollama 0.31.2, macOS 15.3.1, Q4_K_M nicemleme, sabit bir istem ve her model için üç çalıştırma (artı atılan bir ısınma) kullanarak tekrarlanabilir kıyaslamalar yaptı. Sonuçlar: Llama 3.2 3B 46.7 tok/s, Mistral 7B 22.8, Qwen 2.5 7B 22.3, Llama 3.1 8B 21.2, DeepSeek R1 8B 20.0 ve Qwen 2.5 14B 11.7 üretti. İstem işleme hızları saniyede 531 ile 1720 token arasında değişti. Yazar, üretimin bellek sınırlı olduğu sonucuna varıyor; bu nedenle hız kabaca bant genişliğinin model boyutuna bölünmesine eşittir (örneğin, 8B Q4 için tahmini ~25 tok/s, ölçülen 21). M4 Pro ve M4 Max'in çekirdek sayısıyla değil, bant genişliğiyle ölçeklenmesi gerektiğini belirtiyorlar. 16GB için 8B modellerini rahat (20+ tok/s) olarak öneriyorlar, 14B ise yavaş hissettiriyor; daha uzun bağlamlar işlenmesi ucuz ancak üretilmesi pahalı. Sınırlamalar: tek yapılandırma, tek nicemleme, yalnızca metin üretimi; toplu işleme test edilmedi. Veriler CC BY altında açıktır.
Kaynak: Habr — хаб ИИ —
orijinal
