Matériel et Inférence 🇷🇺 03.08.2026 13:02

Mac mini M4 : résultats de débit réel en jetons par seconde

AppleApple MetaMeta MistralMistral Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek
Le propriétaire d'un service de location de Mac a évalué six grands modèles de langage sur un Mac mini M4 (16 Go) avec une méthodologie cohérente, constatant que la vitesse de génération est limitée par la mémoire et évolue inversement avec la taille du modèle. Llama 3.2 3B a atteint 46,7 jetons/s, tandis que Qwen 2.5 14B n'a réussi que 11,7 jetons/s ; le traitement des invites était 10 à 20 fois plus rapide. Conseil pratique : les modèles 8B sont confortables sur 16 Go, les modèles plus grands nécessitent plus de mémoire.
Un propriétaire de service de location de Mac a réalisé des benchmarks reproductibles sur un Mac mini M4 avec 16 Go de mémoire unifiée et une bande passante de 120 Go/s, en utilisant Ollama 0.31.2, macOS 15.3.1, la quantification Q4_K_M, une invite fixe, et trois exécutions par modèle (plus un échauffement jeté). Résultats : Llama 3.2 3B a généré 46,7 tok/s, Mistral 7B 22,8, Qwen 2.5 7B 22,3, Llama 3.1 8B 21,2, DeepSeek R1 8B 20,0, et Qwen 2.5 14B 11,7. Les vitesses de traitement des invites allaient de 531 à 1720 tok/s. L'auteur conclut que la génération est limitée par la mémoire, donc la vitesse approximativement égale à la bande passante divisée par la taille du modèle (par exemple, environ 25 tok/s prédits pour 8B en Q4, 21 mesurés). Il note que le M4 Pro et le M4 Max devraient évoluer avec la bande passante, pas avec les cœurs. Il recommande les modèles de 8B pour 16 Go comme confortables (20+ tok/s), tandis que 14B semble lent ; les contextes longs sont peu coûteux à traiter mais coûteux à générer. Limites : configuration unique, quantification unique, génération de texte uniquement ; aucun traitement par lots testé. Les données sont ouvertes sous licence CC BY.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches