تسريع نماذج Gemini Nano على Pixel باستخدام تنبؤ متعدد الرموز المجمّد

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
أعلنت Google عن تنفيذ تنبؤ متعدد الرموز (Multi-Token Prediction) على نماذج Gemini Nano v3 المجمّدة على أجهزة Pixel 9 و10، مما يسرّع توليد النصوص بأكثر من 50% ويقلّل استهلاك الطاقة. يستخدم MTP رأس محول خفيف الوزن ملحق بالطبقات النهائية للنموذج الأساسي، متجنباً تكرار الذاكرة والحفاظ على الجودة الأصلية.
شركة Google كشفت عن طريقة لتطوير التنبؤ متعدد الرموز (MTP) للنماذج المجمدة المنتشرة، مما يسرع الاستدلال على الأجهزة دون الحاجة إلى نماذج مسودة منفصلة. على عكس الترميز التخميني التقليدي الذي يتطلب نموذجًا صغيرًا منفصلًا، يضيف MTP رأس محول خفيف الوزن إلى الطبقات الأخيرة من النموذج الرئيسي Gemini Nano v3، والذي يستخدم الحالات المخفية المحسوبة مسبقًا بواسطة النموذج الرئيسي وذاكرة التخزين المؤقت للمفتاح والقيمة (ذاكرة التخزين المؤقت KV). هذا يتجنب الاستخدام المزدوج للذاكرة والمعالجة المسبقة للاستفسار. MTP متوافق مع أوزان النموذج الرئيسي المجمدة، مما يضمن تطابق المخرجات والحفاظ على الأمان. على أجهزة Pixel 9 و 10، توفر الطريقة تسريعًا يزيد عن 50% لمهام مثل تلخيص الإشعارات والتحقق من النص. في المتوسط، يتنبأ MTP بشكل صحيح برمزين إضافيين تقريبًا لكل تمريرة استدلال، مما يقلل من عدد خطوات التحقق ويخفض استهلاك الطاقة.
المصدر: Google Research — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة