Gemini Nano -mallien nopeuttaminen Pixelillä jäädytetyn monimerkkiprediktion avulla
Google/DeepMind
Google DeepMind
Google on ilmoittanut ottaneensa käyttöön monimerkkiprediktion jäädytetyillä Gemini Nano v3 -malleilla Pixel 9- ja 10-laitteissa, mikä nopeuttaa tekstin tuottamista yli 50 prosentilla ja vähentää energiankulutusta. MTP käyttää kevyttä transformer-päätä, joka liitetään perusmallin viimeisiin kerroksiin, välttäen muistin kopioinnin ja säilyttäen alkuperäisen laadun.
Google-tutkijat esittelivät menetelmän moni-token-ennustuksen (MTP) päivittämiseen jäädytetyille käyttöönotetuille malleille, mikä nopeuttaa päättelyä laitteilla ilman erillisiä vedosmalleja. Toisin kuin perinteinen spekulatiivinen dekoodaus, joka vaatii erillisen pienen mallin, MTP lisää kevyen muuntimen pään Gemini Nano v3 -mallin viimeisiin kerroksiin, ja se hyödyntää päämallin jo laskemia piilotiloja ja avain-arvo-välimuistia (KV-välimuistia). Tämä välttää kaksoismuistinkäytön ja kehotteen esikäsittelyn. MTP on yhteensopiva päämallin jäädytettyjen painojen kanssa, mikä takaa tulosteiden identtisyyden ja turvallisuuden säilymisen. Pixel 9- ja Pixel 10-laitteilla menetelmä tarjoaa yli 50 prosentin nopeutuksen tehtävissä, kuten ilmoitustiivistelmissä ja tekstin tarkistuksessa. Keskimäärin MTP ennustaa oikein lähes kaksi lisä- tokenia päättelykertaa kohti, mikä vähentää vahvistusvaiheiden määrää ja laskee energiankulutusta.
Lähde: Google Research —
Alkuperäinen
