PesquisaAplicações 🇷🇺 31.07.2026 04:02

Executando LLMs Locais no iPhone: Memória, Core ML, MLX e Limitações

AppleApple MetaMeta
O artigo explora como executar LLMs locais no iPhone, abordando a arquitetura Apple Silicon, memória unificada, quantização, cache KV, Core ML versus MLX, throttling térmico e um pipeline híbrido. Conclui que modelos locais são justificados apenas para cenários críticos de privacidade ou offline, enquanto modelos em nuvem são superiores em outros casos.
O autor, um desenvolvedor iOS, explica os desafios de executar LLMs locais no iPhone. O Apple Silicon usa memória unificada compartilhada por CPU, GPU e ANE, com memória limitada disponível para aplicativos. A quantização reduz o tamanho do modelo (por exemplo, de FP16 para INT4), mas pode degradar a precisão. O cache KV cresce com o comprimento da conversa e pode acionar o Jetsam (o eliminador de memória do sistema). O Core ML oferece otimização estática e compilação AOT, suportando ANE, mas com limitações no comprimento do contexto. O MLX usa avaliação preguiçosa e gráficos dinâmicos, tendo melhor desempenho em loops autorregressivos, mas causando mais calor e throttling. O throttling térmico reduz o desempenho da GPU para manter a temperatura do dispositivo abaixo de 43–45 °C para o conforto do usuário. O autor recomenda monitorar o estado térmico e sugere um pipeline híbrido para geração estável.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas