Hardware & Inferentie 🇷🇺 03.08.2026 13:02

Mac mini M4 real-world tokens per seconde: benchmarkresultaten

AppleApple MetaMeta MistralMistral Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek
Een eigenaar van een Mac-verhuurservice heeft zes LLM's gebenchmarkt op een Mac mini M4 (16 GB) met een consistente methodologie. Hij ontdekte dat de generatiesnelheid geheugengebonden is en omgekeerd evenredig schaalt met de modelgrootte. Llama 3.2 3B haalde 46,7 tok/s, terwijl Qwen 2.5 14B slechts 11,7 tok/s haalde; de verwerking van prompts was 10 tot 20 keer sneller. Praktisch advies: 8B-modellen zijn comfortabel op 16 GB, grotere modellen hebben meer geheugen nodig.
Een eigenaar van een Mac-verhuurservice heeft reproduceerbare benchmarks uitgevoerd op een Mac mini M4 met 16 GB unified memory en 120 GB/s bandbreedte, met behulp van Ollama 0.31.2, macOS 15.3.1, Q4_K_M quantisatie, een vaste prompt en drie runs per model (plus een weggegooide opwarmrun). Resultaten: Llama 3.2 3B genereerde 46,7 tok/s, Mistral 7B 22,8, Qwen 2.5 7B 22,3, Llama 3.1 8B 21,2, DeepSeek R1 8B 20,0, en Qwen 2.5 14B 11,7. De snelheden voor het verwerken van prompts varieerden van 531 tot 1720 tok/s. De auteur concludeert dat generatie geheugengebonden is, dus de snelheid is ongeveer gelijk aan de bandbreedte gedeeld door de modelgrootte (bijv. ~25 tok/s voorspeld voor 8B Q4, 21 gemeten). Ze merken op dat M4 Pro en M4 Max moeten schalen met bandbreedte, niet met cores. Ze raden 8B-modellen aan voor 16GB als comfortabel (20+ tok/s), terwijl 14B traag aanvoelt; langere contexten zijn goedkoop om te verwerken maar duur om te genereren. Beperkingen: enkele configuratie, enkele quantisatie, alleen tekstgeneratie; er is geen batching getest. Data is openbaar onder CC BY.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws