Executando LLMs Locais no iPhone: Memória, Core ML, MLX e Limitações
O artigo explora como executar LLMs locais no iPhone, abordando a arquitetura Apple Silicon, memória unificada, quantização, cache KV, Core ML versus MLX, throttling térmico e um pipeline híbrido. Conclui que modelos locais são justificados apenas para cenários críticos de privacidade ou offline, enquanto modelos em nuvem são superiores em outros casos.
Apple
Meta


