RisetAplikasi 🇷🇺 31.07.2026 04:02

Menjalankan LLM Lokal di iPhone: Memori, Core ML, MLX, dan Keterbatasannya

AppleApple MetaMeta
Artikel ini mengeksplorasi cara menjalankan LLM lokal di iPhone, mencakup arsitektur Apple Silicon, memori terpadu, kuantisasi, cache KV, Core ML versus MLX, penurunan performa termal, dan pipeline hibrida. Kesimpulannya, model lokal hanya layak digunakan untuk skenario yang mengutamakan privasi atau saat offline, sementara model cloud lebih unggul dalam kasus lainnya.
Penulis, seorang pengembang iOS, menjelaskan tantangan menjalankan LLM lokal di iPhone. Apple Silicon menggunakan memori terpadu yang digunakan bersama oleh CPU, GPU, dan ANE, dengan memori terbatas yang tersedia untuk aplikasi. Kuantisasi mengurangi ukuran model (misalnya, FP16 ke INT4) tetapi dapat menurunkan akurasi. Cache KV bertambah seiring panjang percakapan dan dapat memicu Jetsam (pembunuh memori sistem). Core ML menawarkan optimasi statis dan kompilasi AOT, mendukung ANE tetapi dengan batasan panjang konteks. MLX menggunakan evaluasi malas dan grafik dinamis, berkinerja lebih baik dalam loop autoregresif tetapi menyebabkan lebih banyak panas dan throttling. Throttling termal mengurangi kinerja GPU untuk menjaga suhu perangkat tetap di bawah 43–45°C demi kenyamanan pengguna. Penulis merekomendasikan pemantauan status termal dan menyarankan pipeline hibrida untuk pembuatan yang stabil.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru