Запуск локальных LLM на iPhone: память, Core ML, MLX и ограничения

Apple Meta
В статье рассматривается, как запускать локальные LLM (большие языковые модели) на iPhone, освещаются архитектура Apple Silicon, унифицированная память, квантование, KV-кэш, сравнение Core ML и MLX, термальное троттлинг и гибридный конвейер. Автор приходит к выводу, что локальные модели оправданы только в сценариях, критичных к конфиденциальности или при отсутствии интернета, тогда как облачные модели превосходят их в остальных случаях.
Автор, iOS-разработчик, объясняет сложности запуска локальных LLM на iPhone. Apple Silicon использует унифицированную память, разделяемую CPU, GPU и ANE (нейронным движком Apple), при этом для приложений доступно ограниченное количество памяти. Квантование уменьшает размер модели (например, с FP16 до INT4), но может снизить точность. Кэш ключей и значений (KV cache) растет с длиной разговора и
Показать ещё ↓
Источник: Habr — хаб ИИ — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости