Mac mini M4 Token per Detik di Dunia Nyata: Hasil Benchmark
Apple
Meta
Mistral
Alibaba/Qwen
DeepSeek
Pemilik layanan sewa Mac melakukan benchmark terhadap enam LLM pada Mac mini M4 (16GB) menggunakan metodologi yang konsisten, menemukan bahwa kecepatan generasi terikat oleh memori dan berbanding terbalik dengan ukuran model. Llama 3.2 3B mencapai 46,7 tok/s, sedangkan Qwen 2.5 14B hanya mencapai 11,7 tok/s; pemrosesan prompt 10-20 kali lebih cepat. Saran praktis: model 8B nyaman di 16GB, model yang lebih besar memerlukan lebih banyak memori.
Seorang pemilik layanan penyewaan Mac melakukan benchmark yang dapat direproduksi pada Mac mini M4 dengan memori terpadu 16GB dan bandwidth 120 GB/s, menggunakan Ollama 0.31.2, macOS 15.3.1, kuantisasi Q4_K_M, prompt tetap, dan tiga kali percobaan per model (plus satu percobaan pemanasan yang dibuang). Hasilnya: Llama 3.2 3B menghasilkan 46,7 tok/s, Mistral 7B 22,8, Qwen 2.5 7B 22,3, Llama 3.1 8B 21,2, DeepSeek R1 8B 20,0, dan Qwen 2.5 14B 11,7. Kecepatan pemrosesan prompt berkisar antara 531 hingga 1720 tok/s. Penulis menyimpulkan bahwa pembuatan teks terikat oleh memori, sehingga kecepatan kira-kira sama dengan bandwidth dibagi ukuran model (misalnya, ~25 tok/s diprediksi untuk 8B Q4, terukur 21). Mereka mencatat bahwa M4 Pro dan M4 Max seharusnya meningkat seiring bandwidth, bukan inti. Mereka merekomendasikan model 8B untuk 16GB karena nyaman (20+ tok/s), sementara 14B terasa lambat; konteks yang lebih panjang murah untuk diproses tetapi mahal untuk dibuat. Keterbatasan: satu konfigurasi, satu kuantisasi, hanya pembuatan teks; pengelompokan (batching) tidak diuji. Data terbuka di bawah CC BY.
Sumber: Habr — хаб ИИ —
asli
