Mac mini M4 실제 초당 토큰 수: 벤치마크 결과
Apple
Meta
Mistral
Alibaba/Qwen
DeepSeek
맥 렌탈 서비스 운영자가 일관된 방법론으로 Mac mini M4(16GB)에서 6개의 LLM(대규모 언어 모델)을 벤치마크하여, 생성 속도가 메모리 대역폭에 의해 결정되며 모델 크기에 반비례한다는 것을 발견했습니다. Llama 3.2 3B는 초당 46.7토큰을 기록한 반면, Qwen 2.5 14B는 초당 11.7토큰에 그쳤습니다. 프롬프트 처리 속도는 생성 속도보다 10~20배 빨랐습니다. 실용적인 조언: 8B 모델은 16GB에서 무난하게 실행되지만, 더 큰 모델은 더 많은 메모리가 필요합니다.
Mac 임대 서비스 업체 대표가 Ollama 0.31.2, macOS 15.3.1, Q4_K_M 양자화, 고정 프롬프트, 모델당 3회 실행(워밍업 1회 제외)을 사용하여 16GB 통합 메모리와 120GB/s 대역폭을 갖춘 Mac mini M4에서 재현 가능한 벤치마크를 수행했습니다. 결과는 다음과 같습니다: Llama 3.2 3B는 46.7 토큰/초, Mistral 7B는 22.8, Qwen 2.5 7B는 22.3, Llama 3.1 8B는 21.2, DeepSeek R1 8B는 20.0, Qwen 2.5 14B는 11.7이었습니다. 프롬프트 처리 속도는 초당 531~1720 토큰 범위였습니다. 저자는 생성이 메모리 대역폭에 제한되므로 속도는 대략 대역폭을 모델 크기로 나눈 값과 같다고 결론지었습니다(예: 8B Q4의 경우 약 25 토큰/초로 예측, 실제 측정 21). 또한 M4 Pro와 M4 Max는 코어 수가 아닌 대역폭에 따라 확장되어야 한다고 언급했습니다. 16GB의 경우 8B 모델이 20 토큰/초 이상으로 쾌적하다고 권장하지만, 14B는 느리게 느껴집니다. 더 긴 컨텍스트는 처리 비용이 저렴하지만 생성 비용은 비쌉니다. 제한 사항: 단일 구성, 단일 양자화, 텍스트 생성만 해당, 배칭은 테스트하지 않았습니다. 데이터는 CC BY 라이선스로 공개되어 있습니다.
출처: Habr — хаб ИИ —
원문
