OnderzoekHardware & Inferentie 🇺🇸 27.07.2026 05:05

Versnelling van Gemini Nano-modellen op Pixel met Frozen Multi-Token Prediction

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google heeft de implementatie aangekondigd van multi-token predictie op bevroren Gemini Nano v3-modellen op Pixel 9- en 10-apparaten, wat de tekstgeneratie met meer dan 50% versnelt en het energieverbruik verlaagt. MTP gebruikt een lichtgewicht transformer-head die is bevestigd aan de laatste lagen van het basismodel, waardoor geheugenduplicatie wordt vermeden en de oorspronkelijke kwaliteit behouden blijft.
Onderzoekers van Google hebben een methode gepresenteerd voor het moderniseren van multi-token voorspelling (MTP) voor ingevroren geïmplementeerde modellen, wat de inferentie op apparaten versnelt zonder dat er aparte conceptmodellen nodig zijn. In tegenstelling tot traditioneel speculatief decoderen, waarbij een apart klein model vereist is, voegt MTP een lichtgewicht transformatorhoofd toe aan de laatste lagen van het hoofdmodel Gemini Nano v3, dat gebruikmaakt van de door het hoofdmodel reeds berekende verborgen toestanden en de sleutel-waarde-cache (KV-cache). Dit vermijdt dubbel geheugengebruik en voorverwerking van de prompt. MTP is compatibel met ingevroren gewichten van het hoofdmodel, wat zorgt voor identieke uitvoer en behoud van veiligheid. Op Pixel 9- en 10-apparaten levert de methode een versnelling van meer dan 50% op voor taken zoals meldingssamenvatting en tekstcontrole. Gemiddeld voorspelt MTP bijna twee extra tokens per inferentie-doorloop, wat het aantal verificatiestappen vermindert en het energieverbruik verlaagt.
Bron: Google Research — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws