Acelerando Modelos Gemini Nano no Pixel com Predição Congelada de Múltiplos Tokens
Google/DeepMind
Google DeepMind
O Google anunciou a implementação da predição de múltiplos tokens (multi-token prediction, MTP) em modelos congelados Gemini Nano v3 nos dispositivos Pixel 9 e 10, acelerando a geração de texto em mais de 50% e reduzindo o consumo de energia. A MTP utiliza uma cabeça de transformer leve acoplada às camadas finais do modelo base, evitando duplicação de memória e preservando a qualidade original.
Pesquisadores do Google apresentaram um método de modernização da previsão multigrupo (do inglês, Multi-Token Prediction - MTP) para modelos congelados implantados, acelerando a inferência em dispositivos sem a necessidade de modelos auxiliares separados. Diferentemente da decodificação especulativa tradicional, que exige um modelo pequeno separado, o MTP adiciona uma cabeça de transformador leve às últimas camadas do modelo principal Gemini Nano v3, que utiliza os estados ocultos já computados pelo modelo principal e o cache chave-valor (KV-cache). Isso evita o dobro de consumo de memória e o pré-processamento do prompt. O MTP é compatível com pesos congelados do modelo principal, garantindo a identidade das saídas e a preservação da segurança. Em dispositivos Pixel 9 e 10, o método proporciona uma aceleração superior a 50% para tarefas como resumo de notificações e revisão de texto. Em média, o MTP prevê corretamente quase dois tokens adicionais por passagem de inferência, reduzindo o número de etapas de verificação e o consumo de energia.
Fonte: Google Research —
original
