Exécution de LLM locaux sur iPhone : mémoire, Core ML, MLX et limites
Apple
Meta
L'article explore comment exécuter des LLM locaux sur iPhone, en couvrant l'architecture Apple Silicon, la mémoire unifiée, la quantification, le cache KV, Core ML par rapport à MLX, la limitation thermique et un pipeline hybride. Il conclut que les modèles locaux ne se justifient que pour des scénarios critiques pour la vie privée ou hors ligne, tandis que les modèles cloud sont supérieurs dans les autres cas.
L'auteur, un développeur iOS, explique les défis liés à l'exécution de LLM locaux sur iPhone. Apple Silicon utilise une mémoire unifiée partagée entre le CPU, le GPU et l'ANE, avec une mémoire disponible limitée pour les applications. La quantification réduit la taille du modèle (par exemple, de FP16 à INT4) mais peut dégrader la précision. Le cache KV augmente avec la longueur de la conversation et peut déclencher Jetsam (le tueur de mémoire système). Core ML offre une optimisation statique et une compilation AOT, prenant en charge l'ANE mais avec des limitations de longueur de contexte. MLX utilise l'évaluation paresseuse et des graphes dynamiques, performant mieux dans les boucles autorégressives mais provoquant plus de chaleur et de throttling. Le throttling thermique réduit les performances du GPU pour maintenir la température de l'appareil en dessous de 43 à 45 °C pour le confort de l'utilisateur. L'auteur recommande de surveiller l'état thermique et suggère un pipeline hybride pour une génération stable.
Source: Habr — хаб ИИ —
original
