iPhone'da Yerel LLM Çalıştırma: Bellek, Core ML, MLX ve Sınırlamalar
Apple
Meta
Makale, iPhone'da yerel LLM'lerin nasıl çalıştırılacağını inceliyor; Apple Silicon mimarisi, birleşik bellek, niceleme, KV önbelleği, Core ML ile MLX karşılaştırması, termal darboğaz ve melez bir işlem hattı konularını kapsıyor. Sonuç olarak, yerel modellerin yalnızca gizlilik açısından kritik veya çevrimdışı senaryolarda tercih edilmesi gerektiğini, aksi takdirde bulut modellerinin üstün olduğunu belirtiyor.
Yazar, iOS geliştiricisi olarak iPhone'da yerel LLM'lerin çalıştırılmasındaki zorlukları açıklıyor. Apple Silicon, CPU, GPU ve ANE tarafından paylaşılan birleşik bellek kullanır ve uygulamalar için sınırlı miktarda bellek mevcuttur. Niceleme, model boyutunu azaltır (örneğin, FP16'dan INT4'e) ancak doğruluğu düşürebilir. KV önbelleği, konuşma uzunluğuyla birlikte büyür ve Jetsam'ı (sistem bellek kesici) tetikleyebilir. Core ML, ANE'yi destekleyen statik optimizasyon ve AOT derleme sunar, ancak bağlam uzunluğu sınırlamaları vardır. MLX, tembel değerlendirme ve dinamik grafikler kullanır, otoregresif döngülerde daha iyi performans gösterir, ancak daha fazla ısı ve kısıtlamaya neden olur. Termal kısıtlama, cihaz sıcaklığını kullanıcı konforu için 43–45°C'nin altında tutmak amacıyla GPU performansını düşürür. Yazar, termal durumun izlenmesini önerir ve kararlı üretim için hibrit bir boru hattı önerir.
Kaynak: Habr — хаб ИИ —
orijinal
