शोधअनुप्रयोग 🇷🇺 31.07.2026 04:02

iPhone पर स्थानीय LLM चलाना: मेमोरी, Core ML, MLX, और सीमाएं

AppleApple MetaMeta
यह लेख iPhone पर स्थानीय LLM चलाने के तरीके की पड़ताल करता है, जिसमें Apple Silicon आर्किटेक्चर, एकीकृत मेमोरी, क्वांटाइजेशन, KV कैश, Core ML बनाम MLX, थर्मल थ्रॉटलिंग, और एक हाइब्रिड पाइपलाइन शामिल हैं। यह निष्कर्ष निकालता है कि स्थानीय मॉडल केवल गोपनीयता-महत्वपूर्ण या ऑफ़लाइन परिदृश्यों में उचित हैं, अन्यथा क्लाउड मॉडल बेहतर हैं।
लेखक, जो एक iOS डेवलपर हैं, iPhone पर स्थानीय LLM चलाने की चुनौतियों के बारे में बताते हैं। Apple Silicon यूनिफाइड मेमोरी का उपयोग करता है जो CPU, GPU, और ANE द्वारा साझा की जाती है, जिसमें ऐप्स के लिए सीमित मेमोरी उपलब्ध होती है। क्वांटाइज़ेशन मॉडल का आकार कम करता है (जैसे, FP16 से INT4) लेकिन सटीकता घटा सकता है। KV कैश बातचीत की लंबाई के साथ बढ़ता है और जेट्सम (सिस्टम मेमोरी किलर) को ट्रिगर कर सकता है। Core ML स्थैतिक ऑप्टिमाइज़ेशन और AOT कंपाइलेशन प्रदान करता है, ANE का समर्थन करता है लेकिन संदर्भ लंबाई की सीमाएँ होती हैं। MLX लेज़ी इवैलुएशन और डायनामिक ग्राफ़ का उपयोग करता है, ऑटोरिग्रेसिव लूप्स में बेहतर प्रदर्शन करता है लेकिन अधिक गर्मी और थ्रॉटलिंग का कारण बनता है। थर्मल थ्रॉटलिंग GPU प्रदर्शन को कम करती है ताकि डिवाइस का तापमान उपयोगकर्ता के आराम के लिए 43–45°C से नीचे रहे। लेखक थर्मल स्टेट की निगरानी करने की सलाह देते हैं और स्थिर जनरेशन के लिए एक हाइब्रिड पाइपलाइन का सुझाव देते हैं।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार