Mac mini M4: реальные токены в секунду — результаты бенчмарка
Владелец сервиса аренды Mac провел бенчмарк шести LLM на Mac mini M4 (16 ГБ) по единой методологии, выяснив, что скорость генерации ограничена памятью и обратно пропорциональна размеру модели. Llama 3.2 3B достигла 46,7 ток/с, тогда как Qwen 2.5 14B — всего 11,7 ток/с; обработка промпта была в 10-20 раз быстрее. Практический совет: модели 8B комфортно работают на 16 ГБ, для больших моделей нужно больше памяти.
Владелец сервиса аренды Mac провел воспроизводимые бенчмарки на Mac mini M4 с 16 ГБ унифицированной памяти и пропускной способностью 120 ГБ/с, используя Ollama 0.31.2, macOS 15.3.1, квантизацию Q4_K_M, фиксированный промпт и три прогона на модель (плюс отброшенный прогрев). Результаты: Llama 3.2 3B генерировала 46,7 ток/с, Mistral 7B — 22,8, Qwen 2.5 7B — 22,3, Llama 3.1 8B — 21,2, DeepSeek R1 8B
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
