Google Acelera Modelos Gemini Nano no Pixel com Predição de Múltiplos Tokens Congelada
Google/DeepMind
Google DeepMind
A Google introduziu um método para adaptar a Predição de Múltiplos Tokens (MTP) em modelos de produção congelados, como o Gemini Nano v3, permitindo inferência no dispositivo mais rápida nos dispositivos Pixel 9 e 10. O cabeçalho MTP se conecta às camadas finais do modelo principal, aproveitando seus estados ocultos e cache KV para gerar múltiplos tokens por passagem de inferência sem modelos de rascunho separados, alcançando acelerações de 50% ou mais e reduzindo o consumo de memória em 130 MB por instância.
O Google Research anunciou uma nova arquitetura para acelerar modelos de linguagem no dispositivo, como o Gemini Nano v3 em smartphones Pixel. A abordagem adapta a Predição de Múltiplos Tokens (Multi-Token Prediction, MTP) a modelos base congelados, anexando uma cabeça Transformer leve às camadas finais. Essa cabeça MTP usa diretamente o cache chave-valor existente do modelo principal por meio de atenção cruzada, eliminando a necessidade de um modelo rascunho independente e reduzindo a sobrecarga de memória em 130MB por instância. Em tarefas de produção como Resumos de Notificações via IA e Revisão de Texto, o MTP produz quase dois tokens adicionais por passagem de inferência, resultando em melhorias de velocidade superiores a 50% em dispositivos Pixel 9. A saída final é bit a bit idêntica à do modelo base, garantindo alinhamento de segurança e compatibilidade retroativa. O método foi implementado nas séries Pixel 9 e 10, e o Google planeja explorar decodificação paralela e maior flexibilidade de verificação para ganhos adicionais de eficiência.
Fonte: Google Research —
original
