InvestigaciónAplicaciones 🇷🇺 31.07.2026 04:02

Ejecución de LLMs locales en iPhone: memoria, Core ML, MLX y limitaciones

AppleApple MetaMeta
El artículo explora cómo ejecutar LLMs locales en iPhone, abarcando la arquitectura de Apple Silicon, memoria unificada, cuantización, caché KV, Core ML frente a MLX, limitaciones térmicas y un pipeline híbrido. Concluye que los modelos locales solo se justifican en escenarios críticos de privacidad o sin conexión, mientras que los modelos en la nube son superiores en el resto de casos.
El autor, un desarrollador de iOS, explica los desafíos de ejecutar LLM locales en un iPhone. Apple Silicon utiliza memoria unificada compartida por CPU, GPU y ANE, con una cantidad limitada de memoria disponible para las aplicaciones. La cuantificación reduce el tamaño del modelo (por ejemplo, de FP16 a INT4) pero puede degradar la precisión. La caché del contexto crece con la longitud de la conversación y puede provocar Jetsam (el asesino de memoria del sistema). Core ML ofrece optimización estática y compilación AOT, soportando ANE pero con limitaciones en la longitud del contexto. MLX utiliza evaluación perezosa y gráficos dinámicos, y tiene un mejor rendimiento en bucles autorregresivos, pero provoca más calor y reducción de rendimiento. La reducción térmica reduce el rendimiento de la GPU para mantener la temperatura del dispositivo por debajo de 43–45 °C para la comodidad del usuario. El autor recomienda monitorear el estado térmico y sugiere un pipeline híbrido para una generación estable.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas