OnderzoekToepassingen 🇷🇺 31.07.2026 04:02

Lokale LLM's op iPhone uitvoeren: geheugen, Core ML, MLX en beperkingen

AppleApple MetaMeta
Het artikel onderzoekt hoe je lokale LLM's op een iPhone kunt uitvoeren, waarbij de Apple Silicon-architectuur, unified memory, kwantisering, KV-cache, Core ML versus MLX, thermische throttling en een hybride pipeline aan bod komen. Het concludeert dat lokale modellen alleen gerechtvaardigd zijn voor privacygevoelige of offline scenario's, terwijl cloudmodellen in andere gevallen superieur zijn.
De auteur, een iOS-ontwikkelaar, legt de uitdagingen uit van het draaien van lokale LLM's op de iPhone. Apple Silicon gebruikt unified memory die wordt gedeeld door CPU, GPU en ANE, met beperkt beschikbaar geheugen voor apps. Kwantisering verkleint de modelgrootte (bijvoorbeeld van FP16 naar INT4), maar kan de nauwkeurigheid verminderen. De KV-cache groeit met de lengte van het gesprek en kan Jetsam (de systeemgeheugen-killer) triggeren. Core ML biedt statische optimalisatie en AOT-compilatie, met ondersteuning voor ANE, maar heeft beperkingen qua contextlengte. MLX gebruikt lazy evaluation en dynamische grafen, presteert beter in autoregressieve loops, maar veroorzaakt meer hitte en throttling. Thermische throttling vermindert de GPU-prestaties om de apparaattemperatuur onder de 43–45 °C te houden voor het comfort van de gebruiker. De auteur adviseert om de thermische status te monitoren en stelt een hybride pipeline voor voor stabiele generatie.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws