研究应用 🇷🇺 31.07.2026 04:02

在iPhone上运行本地大语言模型:内存、Core ML、MLX及局限性

AppleApple MetaMeta
本文探讨了如何在iPhone上运行本地大语言模型,涵盖苹果芯片架构、统一内存、量化、键值缓存、Core ML与MLX的对比、热节流以及混合流水线。结论是,仅在对隐私有严格要求或离线场景下,本地模型才值得部署;在其他情况下,云端模型更具优势。
作者是一位iOS开发者,阐述了在iPhone上运行本地大语言模型(LLM)所面临的挑战。苹果的芯片(Apple Silicon)采用统一内存,由CPU、GPU和神经网络引擎(ANE)共享,但可供应用程序使用的内存有限。量化可以减少模型大小(例如,从FP16降到INT4),但可能会降低准确性。键值缓存(KV cache)会随着对话长度的增加而增长,并可能触发Jetsam(系统内存杀手)。Core ML提供静态优化和提前编译(AOT),支持ANE,但存在上下文长度限制。MLX采用惰性求值和动态图,在自回归循环中表现更好,但会导致更多发热和降频。热降频会降低GPU性能,以将设备温度保持在43–45°C以下,确保用户舒适。作者建议监控热状态,并提出了一个混合流程以实现稳定生成。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻