Google nopeuttaa Gemini Nano -malleja Pixelissä jäädytetyllä monen tokenin ennusteella
Google/DeepMind
Google DeepMind
Google on esitellyt menetelmän, jolla Multi-Token Prediction (MTP) voidaan liittää jäädytettyihin tuotantomalleihin, kuten Gemini Nano v3:een, mahdollistaen nopeamman päätelaitteistopäättelyn Pixel 9- ja 10-laitteissa. MTP-pää kiinnittyy päämallin viimeisiin kerroksiin hyödyntäen sen piilotiloja ja KV-välimuistia tuottaakseen useita tokeneita päätelmäkertaa kohti ilman erillisiä luonnosmalleja, saavuttaen 50 prosentin tai enemmän nopeutuksen ja vähentäen muistinkulutusta 130 megatavua per instanssi.
Google Research on julkistanut uuden arkkitehtuurin nopeuttaakseen laitteen sisäisiä kielimalleja, kuten Gemini Nano v3:a Pixel-älypuhelimissa. Menetelmässä jäädytettyihin perusmalleihin lisätään Multi-Token Prediction eli MTP-toiminto liittämällä kevyt Transformer-pää viimeisiin kerroksiin. Tämä MTP-pää käyttää suoraan päämallin olemassa olevaa avain-arvo-välimuistia ristiinhuomion kautta, mikä poistaa tarpeen erilliselle luonnosmallille ja vähentää muistin käyttöä 130 megatavua instanssia kohti. Tuotantotehtävissä, kuten tekoälypohjaisissa ilmoitusyhteenvedoissa ja oikoluvussa, MTP tuottaa lähes kaksi ylimääräistä tokenia päättelykierrosta kohti, mikä johtaa yli 50 prosentin nopeusparannuksiin Pixel 9 -laitteilla. Lopputulos on bittitasolla identtinen perusmallin kanssa, mikä takaa turvallisuuden yhdenmukaisuuden ja taaksepäin yhteensopivuuden. Menetelmä on otettu käyttöön Pixel 9- ja 10 -sarjoissa, ja Google aikoo tutkia rinnakkaisdekoodausta ja vahvistuksen joustavuutta tehokkuuden lisäämiseksi.
Lähde: Google Research —
Alkuperäinen
