Mac mini M4 – oikea maailman tokenia sekunnissa: vertailutulokset
Apple
Meta
Mistral
Alibaba/Qwen
DeepSeek
Mac-vuokrauspalvelun omistaja vertaili kuutta kielimallia Mac mini M4:ssä (16GB) yhtenäisellä menetelmällä ja havaitsi, että generointinopeus on muistirajoitteinen ja skaalautuu käänteisesti mallin koon mukaan. Llama 3.2 3B saavutti 46,7 tokenia sekunnissa, kun taas Qwen 2.5 14B pääsi vain 11,7 tokeniin sekunnissa; kehotteen käsittely oli 10-20 kertaa nopeampaa. Käytännön neuvo: 8B-mallit toimivat mukavasti 16GB:ssä, suuremmat mallit vaativat enemmän muistia.
Mac-vuokrauspalvelun omistaja suoritti toistettavat vertailumittaukset Mac mini M4 -tietokoneella, jossa on 16 Gt yhtenäistä muistia ja 120 Gt/s kaistanleveys, käyttäen Ollama 0.31.2 -versiota, macOS 15.3.1 -käyttöjärjestelmää, Q4_K_M-kvantisointia, kiinteää kehotetta ja kolmea ajokertaa mallia kohden (sekä yhden hylätyn lämmittelyajon). Tulokset: Llama 3.2 3B tuotti 46,7 tok/s, Mistral 7B 22,8, Qwen 2.5 7B 22,3, Llama 3.1 8B 21,2, DeepSeek R1 8B 20,0 ja Qwen 2.5 14B 11,7. Kehotteen käsittelynopeudet vaihtelivat 531:stä 1720:een tok/s. Kirjoittaja päättelee, että generointi on muistisidonnaista, joten nopeus on suunnilleen yhtä suuri kuin kaistanleveys jaettuna mallin koolla (esim. ~25 tok/s ennustettu 8B Q4:lle, mitattu 21). Hän huomauttaa, että M4 Pro ja M4 Max skaalautuvat kaistanleveyden, eivät ytimien, mukaan. Hän suosittelee 8B-malleja 16 Gt:lle mukavina (yli 20 tok/s), kun taas 14B tuntuu hitaalta; pidemmät kontekstit ovat halpoja käsitellä, mutta kalliita generoida. Rajoitukset: yksi kokoonpano, yksi kvantisointi, vain tekstin generointi; eräkäsittelyä ei testattu. Data on avointa CC BY -lisenssillä.
Lähde: Habr — хаб ИИ —
Alkuperäinen
