DiffusionGemma: توليد نصوص أسرع بمقدار 4 أضعاف
Google/DeepMind
DeepMind
NVIDIA
قدّمت Google DeepMind نموذج DiffusionGemma، وهو نموذج تجريبي مفتوح المصدر من نوع Mixture of Experts بحجم 26 مليار معلمة، يستخدم تقنية الانتشار النصي لتوليد نصوص أسرع بمقدار 4 مرات مقارنةً بنماذج اللغة الكبيرة ذاتية التراجع على وحدات معالجة الرسوميات. يعالج هذا النموذج كتلًا من 256 رمزًا في وقت واحد، بهدف تحسين سير العمل المحلي الحساسة للسرعة مثل التحرير الفوري، وتم إصداره بموجب ترخيص Apache 2.0 على منصة Hugging Face.
أعلنت جوجل ديب مايند عن إطلاق نموذج DiffusionGemma التجريبي، وهو نموذج مختلط الخبراء (Mixture of Experts) يضم 26 مليار معامل بموجب ترخيص Apache 2.0، ويحقق تسريعًا في توليد النصوص يصل إلى أربعة أضعاف من خلال اعتماد نهج قائم على الانتشار بدلاً من التنبؤ التسلسلي بالرموز. يُنشط النموذج 3.8 مليار معامل فقط لكل عملية استدلال، مما يناسب ذاكرة فيديو بحجم 18 جيجابايت عند ضغطه، ويحقق أكثر من 1000 رمز في الثانية على معالج NVIDIA H100 و700 رمز على GeForce RTX 5090. يستخدم النموذج انتباهًا ثنائي الاتجاه لتوليد 256 رمزًا بالتوازي، مما يتيح مهامًا غير خطية مثل استكمال الشيفرة البرمجية وحل ألغاز سودوكو. تم تحسين DiffusionGemma للاستدلال المحلي منخفض التزامن، حيث يوفر فك الترميز المتوازي أقصى فائدة، بينما تظل النماذج الذاتية التراجعية أفضل للخدمات السحابية عالية الطلب في الثانية. يقوم النموذج بتحسين مخرجاته بشكل تكرري، ويمكن ضبطه بدقة باستخدام أدوات مثل Unsloth وHugging Face وvLLM وMLX وJAX وNVIDIA NeMo، مع دعم قادم من llama.cpp. تعاونت جوجل ديب مايند مع إنفيديا لتحسينات الأجهزة بما في ذلك نوى NVFP4، ويتوفر النموذج على Hugging Face ومنصة Gemini Enterprise Agent وNVIDIA NIM.
المصدر: Google DeepMind —
الأصلي
