Beschleunigung von Gemini Nano Modellen auf Pixel mit eingefrorener Multi-Token-Vorhersage
Google/DeepMind
Google DeepMind
Google hat die Implementierung der Multi-Token-Vorhersage auf eingefrorenen Gemini Nano v3 Modellen auf Pixel 9 und 10 Geräten angekündigt, wodurch die Textgenerierung um über 50 Prozent beschleunigt und der Energieverbrauch gesenkt wird. MTP verwendet einen leichten Transformer-Head, der an den letzten Schichten des Basismodells angebracht ist, wodurch Speicherduplikate vermieden und die ursprüngliche Qualität erhalten bleibt.
Google-Forscher haben eine Methode zur Nachrüstung von Multi-Token Prediction (MTP) für eingefrorene bereitgestellte Modelle vorgestellt, die die Inferenz auf Geräten beschleunigt, ohne dass separate Draft-Modelle erforderlich sind. Im Gegensatz zum traditionellen spekulativen Decodieren, bei dem ein separates kleines Modell benötigt wird, fügt MTP einen leichtgewichtigen Transformer-Kopf zu den letzten Schichten des Hauptmodells Gemini Nano v3 hinzu, der die bereits vom Hauptmodell berechneten versteckten Zustände und den Key-Value-Cache nutzt. Dies vermeidet doppelten Speicherverbrauch und die Vorverarbeitung des Prompts. MTP ist mit den eingefrorenen Gewichten des Hauptmodells kompatibel, was die Identität der Ausgaben und die Sicherheit gewährleistet. Auf den Geräten Pixel 9 und 10 erzielt die Methode eine Beschleunigung von über 50 Prozent für Aufgaben wie Zusammenfassung von Benachrichtigungen und Textüberprüfung. Im Durchschnitt sagt MTP pro Inferenzdurchlauf fast zwei zusätzliche Token korrekt voraus, was die Anzahl der Verifizierungsschritte reduziert und den Energieverbrauch senkt.
Quelle: Google Research —
Original
