Donanım ve ÇıkarımModeller 🇺🇸 27.07.2026 05:05

Google, Pixel'de Dondurulmuş Çoklu Token Tahmini ile Gemini Nano Modellerini Hızlandırıyor

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google, donmuş üretim modellerine Çoklu Token Tahmini (Multi-Token Prediction - MTP) eklemek için bir yöntem tanıttı. Bu yöntem, Gemini Nano v3 gibi modellerde Pixel 9 ve 10 cihazlarında daha hızlı cihaz içi çıkarım sağlıyor. MTP başlığı, ana modelin son katmanlarına bağlanarak gizli durumlarından ve KV önbelleğinden yararlanıyor ve ayrı taslak modellere ihtiyaç duymadan her çıkarım adımında birden fazla token üreterek %50 veya daha fazla hızlanma ve her bir örnekte 130MB bellek tüketimi azalması sağlıyor.
Google Research, Pixel akıllı telefonlardaki Gemini Nano v3 gibi cihaz üstü dil modellerini hızlandırmak için yeni bir mimari duyurdu. Bu yaklaşım, son katmanlara hafif bir Transformer başlığı ekleyerek donmuş temel modellere Çoklu-Token Tahmini'ni (Multi-Token Prediction - MTP) sonradan entegre ediyor. Bu MTP başlığı, çapraz dikkat (cross-attention) yoluyla doğrudan ana modelin mevcut anahtar-değer önbelleğini kullanarak bağımsız bir taslak model ihtiyacını ortadan kaldırıyor ve örnek başına bellek yükünü 130MB azaltıyor. AI Bildirim Özetleri ve Düzeltme (Proofread) gibi üretim görevlerinde MTP, çıkarım geçişi başına neredeyse iki ek token üretiyor ve Pixel 9 cihazlarında %50'nin üzerinde hız iyileştirmesi sağlıyor. Nihai çıktı, temel modelle bit düzeyinde aynı olup güvenlik uyumluluğunu ve geriye dönük uyumluluğu garanti ediyor. Yöntem, Pixel 9 ve 10 serilerine sunuldu ve Google, daha fazla verimlilik kazanımı için paralel kod çözme ve doğrulama esnekliğini araştırmayı planlıyor.
Kaynak: Google Research — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler