Paikallisten kielimallien ajaminen iPhonessa: muisti, Core ML, MLX ja rajoitukset
Apple
Meta
Artikkelissa tarkastellaan paikallisten kielimallien (LLM) ajamista iPhonessa, käsitellen Apple Silicon -arkkitehtuuria, yhtenäistä muistia, kvantisointia, KV-välimuistia, Core ML:n ja MLX:n vertailua, lämpösammumista sekä hybridiputkistoa. Johtopäätöksenä on, että paikalliset mallit ovat perusteltuja vain yksityisyyden kannalta kriittisissä tai offline-tilanteissa, kun taas pilvimallit ovat muuten parempia.
Kirjoittaja, iOS-kehittäjä, selittää paikallisten LLM-mallien ajamisen haasteita iPhonessa. Apple Silicon käyttää yhtenäistä muistia, jota jakavat CPU, GPU ja ANE, ja sovelluksille on rajoitetusti muistia. Kvantisointi pienentää mallin kokoa (esim. FP16→INT4), mutta voi heikentää tarkkuutta. KV-välimuisti kasvaa keskustelun pituuden myötä ja voi laukaista Jetsam-nimisen järjestelmän muistin tappajan. Core ML tarjoaa staattista optimointia ja AOT-käännöstä, tukee ANE:ta, mutta kontekstin pituudella on rajoituksia. MLX käyttää laiskaa evaluointia ja dynaamisia laskentakaavioita, suoriutuen paremmin autoregressiivisissä silmukoissa, mutta tuottaa enemmän lämpöä ja aiheuttaa suorituskyvyn rajoitusta. Terminen rajoitus vähentää GPU:n suorituskykyä, jotta laitteen lämpötila pysyy alle 43–45 °C:ssa käyttäjän mukavuuden vuoksi. Kirjoittaja suosittelee lämpötilan seuraamista ja ehdottaa hybridiputkea vakaaseen generointiin.
Lähde: Habr — хаб ИИ —
Alkuperäinen
