Hardware & InferentieModellen 🇺🇸 27.07.2026 05:05

Google versnelt Gemini Nano-modellen op Pixel met Frozen Multi-Token Prediction

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google heeft een methode geïntroduceerd om Multi-Token Prediction (MTP) te integreren in bevroren productiemodellen zoals Gemini Nano v3, waardoor snellere on-device inferentie op Pixel 9- en 10-apparaten mogelijk wordt. De MTP-head wordt aan de laatste lagen van het hoofdmodel bevestigd, maakt gebruik van de verborgen toestanden en KV-cache om meerdere tokens per inferentiepassage te genereren zonder aparte draftmodellen, wat snelheidswinsten van 50% of meer oplevert en het geheugengebruik met 130 MB per instantie vermindert.
Google Research heeft een nieuwe architectuur aangekondigd voor het versnellen van on-device taalmodellen zoals Gemini Nano v3 op Pixel-smartphones. De aanpak breidt Multi-Token Prediction (MTP) retroactief uit op bevroren basismodellen door een lichtgewicht Transformer-head aan de laatste lagen toe te voegen. Deze MTP-head maakt direct gebruik van de bestaande key-value cache van het hoofdmodel via cross-attention, waardoor een aparte drater overbodig wordt en het geheugengebruik met 130 MB per instantie wordt verminderd. In productietaken zoals AI Notification Summaries en Proofread produceert MTP bijna twee extra tokens per inferentie, wat leidt tot snelheidsverbeteringen van meer dan 50% op Pixel 9-apparaten. De uiteindelijke uitvoer is bit-identiek aan het basismodel, wat veiligheidsafstemming en achterwaartse compatibiliteit garandeert. De methode is uitgerold naar de Pixel 9- en 10-serie, en Google is van plan om parallelle decodering en verificatielening te verkennen voor verdere efficiëntiewinst.
Bron: Google Research — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws