Phần cứng & Suy luậnMô hình 🇺🇸 27.07.2026 05:05

Google tăng tốc mô hình Gemini Nano trên Pixel với Multi-Token Prediction đóng băng

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google đã giới thiệu một phương pháp để tích hợp Multi-Token Prediction (MTP) vào các mô hình sản xuất đã đóng băng như Gemini Nano v3, cho phép suy luận nhanh hơn trên thiết bị trên Pixel 9 và 10. MTP head gắn vào các lớp cuối cùng của mô hình chính, tận dụng các trạng thái ẩn và KV cache của nó để tạo ra nhiều token mỗi lần suy luận mà không cần các mô hình soạn thảo riêng biệt, đạt tốc độ tăng 50% trở lên và giảm mức tiêu thụ bộ nhớ 130MB mỗi phiên bản.
Google Research đã công bố một kiến trúc mới nhằm tăng tốc các mô hình ngôn ngữ trên thiết bị như Gemini Nano v3 trên điện thoại thông minh Pixel. Phương pháp này tích hợp Multi-Token Prediction (MTP) vào các mô hình cơ sở đã đóng băng bằng cách thêm một đầu Transformer nhẹ vào các lớp cuối cùng. Đầu MTP này sử dụng trực tiếp bộ đệm khóa-giá trị (key-value cache) hiện có của mô hình chính thông qua cơ chế cross-attention, loại bỏ nhu cầu về một mô hình soạn thảo độc lập và giảm 130 MB bộ nhớ cho mỗi phiên bản. Trong các tác vụ sản xuất như AI Notification Summaries và Proofread, MTP tạo ra gần hai token bổ sung cho mỗi lần suy luận, dẫn đến cải thiện tốc độ hơn 50% trên thiết bị Pixel 9. Đầu ra cuối cùng hoàn toàn giống hệt bit với mô hình cơ sở, đảm bảo an toàn và khả năng tương thích ngược. Phương pháp này đã được triển khai trên dòng Pixel 9 và 10, và Google có kế hoạch khám phá việc giải mã song song (parallel decoding) và nới lỏng xác minh để đạt được hiệu quả cao hơn.
Nguồn: Google Research — bản gốc
Bài viết liên quan trước đây ↓
Tin mới