Perangkat Keras & InferensiModel 🇺🇸 27.07.2026 05:05

Google Percepat Model Gemini Nano di Pixel dengan Multi-Token Prediction Beku

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google memperkenalkan metode untuk memasang Multi-Token Prediction (MTP) pada model produksi beku seperti Gemini Nano v3, memungkinkan inferensi di perangkat yang lebih cepat di Pixel 9 dan 10. Kepala MTP terpasang pada lapisan akhir model utama, memanfaatkan hidden states dan cache KV untuk menghasilkan beberapa token per langkah inferensi tanpa model drafting terpisah, mencapai peningkatan kecepatan 50% atau lebih dan mengurangi konsumsi memori sebesar 130MB per instance.
Google Research mengumumkan arsitektur baru untuk mempercepat model bahasa di perangkat seperti Gemini Nano v3 di ponsel pintar Pixel. Pendekatan ini menggunakan kembali Multi-Token Prediction (MTP) pada model dasar yang dibekukan dengan menambahkan kepala Transformer ringan pada lapisan terakhir. Kepala MTP ini secara langsung menggunakan cache key-value yang sudah ada dari model utama melalui cross-attention, sehingga menghilangkan kebutuhan akan model drafter mandiri dan mengurangi overhead memori sebesar 130MB per instance. Dalam tugas produksi seperti Ringkasan Pemberitahuan AI dan Proofread, MTP menghasilkan hampir dua token tambahan per langkah inferensi, menghasilkan peningkatan kecepatan lebih dari 50% pada perangkat Pixel 9. Output akhir identik secara bit dengan model dasar, memastikan keselarasan keamanan dan kompatibilitas mundur. Metode ini telah diluncurkan ke seri Pixel 9 dan 10, serta Google berencana untuk mengeksplorasi decoding paralel dan kelonggaran verifikasi untuk peningkatan efisiensi lebih lanjut.
Sumber: Google Research — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru