硬件与推理模型 🇺🇸 27.07.2026 05:05

Google 通过冻结多令牌预测加速 Pixel 上的 Gemini Nano 模型

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google 引入了一种方法,将多令牌预测(MTP)改造到冻结的生产模型(如 Gemini Nano v3)上,从而在 Pixel 9 和 Pixel 10 设备上实现更快的设备端推理。MTP 头部附加到主模型的最终层,利用其隐藏状态和 KV 缓存,在每次推理中生成多个令牌,无需单独的草稿模型,速度提升 50% 或更多,并且每个实例减少 130MB 内存消耗。
谷歌研究院宣布推出一种新架构,用于加速Pixel智能手机上的端到端语言模型(例如Gemini Nano v3)。该方法通过在多标记预测(MTP)中,为冻结的基础模型附加一个轻量级Transformer头,从而对其进行改造。这个MTP头通过交叉注意力直接利用主模型现有的键值缓存,消除了对独立草稿模型的需求,并将每个实例的内存开销减少130MB。在AI通知摘要和Proofread等生产任务中,MTP每次推理可额外生成近两个标记,使Pixel 9设备的速度提升超过50%。最终输出与基础模型在比特级别完全一致,确保安全对齐和向后兼容。该方法已部署到Pixel 9和10系列,谷歌计划进一步探索并行解码和验证宽松性以提升效率。
来源: Google Research — 原文
我们之前关于此话题的帖子 ↓
最新新闻