iPhone पर स्थानीय LLM चलाना: मेमोरी, Core ML, MLX, और सीमाएं
Apple
Meta
यह लेख iPhone पर स्थानीय LLM चलाने के तरीके की पड़ताल करता है, जिसमें Apple Silicon आर्किटेक्चर, एकीकृत मेमोरी, क्वांटाइजेशन, KV कैश, Core ML बनाम MLX, थर्मल थ्रॉटलिंग, और एक हाइब्रिड पाइपलाइन शामिल हैं। यह निष्कर्ष निकालता है कि स्थानीय मॉडल केवल गोपनीयता-महत्वपूर्ण या ऑफ़लाइन परिदृश्यों में उचित हैं, अन्यथा क्लाउड मॉडल बेहतर हैं।
लेखक, जो एक iOS डेवलपर हैं, iPhone पर स्थानीय LLM चलाने की चुनौतियों के बारे में बताते हैं। Apple Silicon यूनिफाइड मेमोरी का उपयोग करता है जो CPU, GPU, और ANE द्वारा साझा की जाती है, जिसमें ऐप्स के लिए सीमित मेमोरी उपलब्ध होती है। क्वांटाइज़ेशन मॉडल का आकार कम करता है (जैसे, FP16 से INT4) लेकिन सटीकता घटा सकता है। KV कैश बातचीत की लंबाई के साथ बढ़ता है और जेट्सम (सिस्टम मेमोरी किलर) को ट्रिगर कर सकता है। Core ML स्थैतिक ऑप्टिमाइज़ेशन और AOT कंपाइलेशन प्रदान करता है, ANE का समर्थन करता है लेकिन संदर्भ लंबाई की सीमाएँ होती हैं। MLX लेज़ी इवैलुएशन और डायनामिक ग्राफ़ का उपयोग करता है, ऑटोरिग्रेसिव लूप्स में बेहतर प्रदर्शन करता है लेकिन अधिक गर्मी और थ्रॉटलिंग का कारण बनता है। थर्मल थ्रॉटलिंग GPU प्रदर्शन को कम करती है ताकि डिवाइस का तापमान उपयोगकर्ता के आराम के लिए 43–45°C से नीचे रहे। लेखक थर्मल स्टेट की निगरानी करने की सलाह देते हैं और स्थिर जनरेशन के लिए एक हाइब्रिड पाइपलाइन का सुझाव देते हैं।
स्रोत: Habr — хаб ИИ —
मूल
