Hardware e Inferência 🇷🇺 03.08.2026 13:02

Mac mini M4 Tokens por Segundo no Mundo Real: Resultados de Benchmark

AppleApple MetaMeta MistralMistral Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek
O proprietário de um serviço de aluguel de Macs avaliou seis LLMs em um Mac mini M4 (16GB) usando uma metodologia consistente, descobrindo que a velocidade de geração é limitada pela memória e escala inversamente com o tamanho do modelo. O Llama 3.2 3B atingiu 46,7 tok/s, enquanto o Qwen 2.5 14B alcançou apenas 11,7 tok/s; o processamento de prompt foi 10 a 20 vezes mais rápido. Conselho prático: modelos de 8B são confortáveis em 16GB, modelos maiores precisam de mais memória.
O proprietário de um serviço de aluguel de Mac realizou benchmarks reproduzíveis em um Mac mini M4 com 16GB de memória unificada e largura de banda de 120 GB/s, usando Ollama 0.31.2, macOS 15.3.1, quantização Q4_K_M, um prompt fixo e três execuções por modelo (mais um descarte para aquecimento). Resultados: Llama 3.2 3B gerou 46,7 tok/s, Mistral 7B 22,8, Qwen 2.5 7B 22,3, Llama 3.1 8B 21,2, DeepSeek R1 8B 20,0 e Qwen 2.5 14B 11,7. As velocidades de processamento de prompt variaram de 531 a 1720 tok/s. O autor conclui que a geração é limitada pela memória, então a velocidade é aproximadamente igual à largura de banda dividida pelo tamanho do modelo (por exemplo, ~25 tok/s previstos para 8B Q4, 21 medidos). Eles observam que o M4 Pro e o M4 Max devem escalar com a largura de banda, não com os núcleos. Eles recomendam modelos 8B para 16GB como confortáveis (20+ tok/s), enquanto 14B parece lento; contextos mais longos são baratos de processar, mas caros de gerar. Limitações: configuração única, quantização única, apenas geração de texto; nenhum teste de batelada. Os dados são abertos sob CC BY.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas