研究硬件与推理 🇺🇸 27.07.2026 05:05

在 Pixel 设备上通过冻结多Token预测加速Gemini Nano模型

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
谷歌宣布在 Pixel 9 和 10 设备上对冻结的 Gemini Nano v3 模型实现多Token预测,将文本生成速度提升超过 50%,并降低能耗。MTP 使用了一个轻量级 Transformer 头部,附加在基础模型的最终层上,避免了内存重复,并保留了原始质量。
Google研究人员提出了一种针对已冻结部署模型的多token预测(MTP)升级方法,该方法无需单独的草稿模型即可加速设备端推理。与传统投机性解码需要独立的小模型不同,MTP在Gemini Nano v3基座模型的最后几层添加了一个轻量级Transformer预测头,该预测头利用基座模型已计算出的隐藏状态和键值缓存(KV缓存)。这避免了内存翻倍和提示预处理的消耗。MTP与基座模型的冻结权重兼容,确保了输出结果的一致性及安全性。在Pixel 9和10设备上,该方法在通知摘要、文本校对等任务中实现了超过50%的加速。平均而言,MTP每次推理能正确预测近两个额外的token,从而减少了验证步骤,降低了能耗。
来源: Google Research — 原文
我们之前关于此话题的帖子 ↓
最新新闻