Mac mini M4 Tokens Por Segundo en el Mundo Real: Resultados de Benchmark
Apple
Meta
Mistral
Alibaba/Qwen
DeepSeek
El propietario de un servicio de alquiler de Mac realizó un benchmark de seis LLM en una Mac mini M4 (16GB) usando una metodología consistente, encontrando que la velocidad de generación está limitada por la memoria y escala inversamente con el tamaño del modelo. Llama 3.2 3B alcanzó 46.7 tok/s, mientras que Qwen 2.5 14B solo logró 11.7 tok/s; el procesamiento de prompts fue 10-20 veces más rápido. Consejo práctico: los modelos de 8B son cómodos en 16GB, los modelos más grandes necesitan más memoria.
El propietario de un servicio de alquiler de Mac realizó pruebas comparativas reproducibles en una Mac mini M4 con 16 GB de memoria unificada y 120 GB/s de ancho de banda, utilizando Ollama 0.31.2, macOS 15.3.1, cuantización Q4_K_M, un prompt fijo y tres ejecuciones por modelo (más una de calentamiento descartada). Resultados: Llama 3.2 3B generó 46.7 tokens por segundo, Mistral 7B 22.8, Qwen 2.5 7B 22.3, Llama 3.1 8B 21.2, DeepSeek R1 8B 20.0 y Qwen 2.5 14B 11.7. Las velocidades de procesamiento del prompt oscilaron entre 531 y 1720 tokens por segundo. El autor concluye que la generación está limitada por la memoria, por lo que la velocidad es aproximadamente igual al ancho de banda dividido por el tamaño del modelo (por ejemplo, ~25 tokens por segundo previstos para 8B Q4, 21 medidos). Señala que M4 Pro y M4 Max deberían escalar con el ancho de banda, no con los núcleos. Recomienda modelos de 8B para 16 GB como cómodos (más de 20 tokens por segundo), mientras que 14B se siente lento; los contextos largos son baratos de procesar pero caros de generar. Limitaciones: configuración única, cuantización única, solo generación de texto; no se probó el procesamiento por lotes. Los datos son abiertos bajo licencia CC BY.
Fuente: Habr — хаб ИИ —
original
