iPhoneでローカルLLMを実行する:メモリ、Core ML、MLX、および制限
Apple
Meta
この記事では、iPhone上でローカルLLMを実行する方法を探り、Apple Siliconのアーキテクチャ、ユニファイドメモリ、量子化、KVキャッシュ、Core MLとMLXの比較、熱スロットリング、ハイブリッドパイプラインについて説明します。ローカルモデルは、プライバシーが重要またはオフラインのシナリオでのみ正当化され、それ以外の場合はクラウドモデルが優れていると結論付けています。
著者はiOS開発者であり、iPhone上でローカルLLMを実行する際の課題について説明しています。Apple SiliconはCPU、GPU、ANEが共有するユニファイドメモリを使用しており、アプリが利用できるメモリは限られています。量子化はモデルサイズを削減します(例:FP16からINT4)が、精度を低下させる可能性があります。KVキャッシュは会話の長さに応じて増加し、Jetsam(システムのメモリキラー)を引き起こす可能性があります。Core MLは静的最適化とAOTコンパイルを提供し、ANEをサポートしますが、コンテキスト長に制限があります。MLXは遅延評価と動的グラフを使用し、自己回帰ループで優れたパフォーマンスを発揮しますが、より多くの熱とスロットリングを引き起こします。サーマルスロットリングは、デバイスの温度を43〜45°C未満に保つためにGPUパフォーマンスを低下させ、ユーザーの快適さを確保します。著者はサーマル状態の監視を推奨し、安定した生成のためのハイブリッドパイプラインを提案しています。
出典: Habr — хаб ИИ —
原文
