iPhone에서 로컬 LLM 실행하기: 메모리, Core ML, MLX 및 제한 사항
Apple
Meta
이 기사는 iPhone에서 로컬 LLM을 실행하는 방법을 탐구하며, Apple Silicon 아키텍처, 통합 메모리, 양자화, KV 캐시, Core ML과 MLX의 비교, 열 조절(throttling) 및 하이브리드 파이프라인을 다룹니다. 결론적으로 로컬 모델은 개인정보 보호가 중요한 경우나 오프라인 상황에서만 정당하며, 그 외에는 클라우드 모델이 더 우수하다고 설명합니다.
저자는 iOS 개발자로서 iPhone에서 로컬 LLM을 실행할 때의 어려움을 설명한다. Apple Silicon은 CPU, GPU, ANE가 공유하는 통합 메모리를 사용하며, 앱에서 사용할 수 있는 메모리는 제한적이다. 양자화는 모델 크기를 줄이지만(예: FP16에서 INT4로) 정확도를 저하시킬 수 있다. KV 캐시는 대화 길이에 따라 증가하며 Jetsam(시스템 메모리 킬러)을 트리거할 수 있다. Core ML은 정적 최적화와 AOT 컴파일을 제공하여 ANE를 지원하지만 컨텍스트 길이에 제한이 있다. MLX는 지연 평가와 동적 그래프를 사용하여 자동 회귀 루프에서 더 나은 성능을 보이지만 발열과 스로틀링을 더 많이 유발한다. 열 스로틀링은 사용자 편의를 위해 기기 온도를 43–45°C 이하로 유지하기 위해 GPU 성능을 감소시킨다. 저자는 열 상태 모니터링을 권장하며 안정적인 생성을 위한 하이브리드 파이프라인을 제안한다.
출처: Habr — хаб ИИ —
원문
