تسريع نماذج Gemini Nano على Pixel عبر تعدد التنبؤ بالرموز المجمد

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
قدمت جوجل طريقة لدمج خاصية تعدد التنبؤ بالرموز (Multi-Token Prediction - MTP) في النماذج الإنتاجية المجمدة مثل Gemini Nano v3، مما يتيح استدلالًا أسرع على الأجهزة في هواتف Pixel 9 وPixel 10. يلتصق رأس MTP بالطبقات الأخيرة من النموذج الرئيسي، مستفيدًا من حالاته المخفية وذاكرة التخزين المؤقت KV لتوليد عدة رموز لكل عملية استدلال دون الحاجة إلى نماذج منفصلة للمسودة، مما يحقق تسريعًا بنسبة 50% أو أكثر ويقلل استهلاك الذاكرة بمقدار 130 ميجابايت لكل مثيل.
أعلنت جوجل للأبحاث عن بنية جديدة لتسريع النماذج اللغوية على الأجهزة، مثل نموذج جيميني نانو الإصدار الثالث (Gemini Nano v3) على هواتف بيكسل الذكية. تعمل هذه الطريقة على تركيب التنبؤ متعدد الرموز (Multi-Token Prediction - MTP) على النماذج الأساسية المجمدة عن طريق إضافة رأس محول خفيف الوزن (Transformer head) إلى الطبقات النهائية. يستخدم رأس MTP هذا مباشرة ذاكرة التخزين المؤقت للمفاتيح والقيم (key-value cache) الموجودة في النموذج الرئيسي عبر آلية الانتباه المتقاطع (cross-attention)، مما يلغي الحاجة إلى نموذج مسودة مستقل (standalone drafter model) ويقلل من الحمل على الذاكرة بمقدار 130 ميجابايت لكل مثيل. في المهام الإنتاجية مثل ملخصات الإشعارات الذكية (AI Notification Summaries) والتدقيق اللغوي (Proofread)، ينتج MTP ما يقرب من رمزين إضافيين لكل عملية استدلال (inference pass)، مما يؤدي إلى تحسينات في السرعة تتجاوز 50% على أجهزة بيكسل 9. المخرجات النهائية متطابقة بتًا مع النموذج الأساسي، مما يضمن توافق السلامة والتوافق العكسي. تم طرح هذه الطريقة على سلسلتي بيكسل 9 و10، وتخطط جوجل لاستكشاف فك التشفير المتوازي (parallel decoding) والمرونة في التحقق (verification leniency) لتحقيق مزيد من الكفاءة.
المصدر: Google Research — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة