النماذجمفتوح المصدر 🇺🇸 27.07.2026 12:02

DiffusionGemma: تسريع توليد النص حتى 4 مرات

Google/DeepMindGoogle/DeepMind DeepMindDeepMind NVIDIANVIDIA
قدمت Google DeepMind نموذج DiffusionGemma، وهو نموذج مفتوح تجريبي يعتمد على نشر النص. يقوم النموذج بتوليد كتل كاملة من النص في وقت واحد، محققًا تسريعًا يصل إلى 4 أضعاف مقارنة بنماذج اللغة الكبيرة ذاتية التراجع، وهو مصمم للباحثين والمطورين الذين يعملون في سيناريوهات محلية وحساسة لزمن الاستجابة.
أعلنت Google DeepMind عن DiffusionGemma، وهو نموذج تجريبي مفتوح المصدر (برخصة Apache 2.0) يستخدم نشر النص للتوليد. على عكس نماذج اللغة الكبيرة التقليدية ذاتية التراجع التي تعالج الرموز المميزة بشكل تسلسلي، يولد DiffusionGemma كتلًا من النص في وقت واحد، محققًا تسريعًا يصل إلى 4 أضعاف على وحدة معالجة الرسوميات (أكثر من 1000 رمز مميز في الثانية على NVIDIA H100 واحد، وأكثر من 700 رمز مميز في الثانية على NVIDIA GeForce RTX 5090). يتميز النموذج بهندسة خليط الخبراء (Mixture of Experts) بـ 26 مليار معلمة، ولكنه ينشط فقط 3.8 مليار أثناء الاستدلال، مما يسمح بوضعه في 18 غيغابايت من ذاكرة الفيديو عند التكميم. الميزات الرئيسية: انتباه ثنائي الاتجاه (256 رمزًا مميزًا لكل تمريرة)، تصحيح ذاتي تكراري، والتركيز على المهام غير الخطية مثل تحرير الكود، ملء الفراغات، أو التعامل مع تسلسلات الأحماض الأمينية. ومع ذلك، فإن جودة المخرجات أقل من نظيرتها Gemma 4 القياسية؛ يُوصى للمطورين الذين يحتاجون إلى أقصى دقة باستخدام النسخة ذاتية التراجع. يكون DiffusionGemma فعالًا بشكل خاص عند الاستدلال المحلي مع ازدحام منخفض؛ أما في السحابة ذات الإنتاجية العالية، فإن المكسب يقل. النموذج متاح بالفعل للتنزيل على Hugging Face، وهو مدعوم في MLX وvLLM وHugging Face Transformers؛ ومن المخطط دمجه مع llama.cpp. تعاونت DeepMind مع NVIDIA لتحسين الأداء على وحدات معالجة الرسوميات الاستهلاكية والمؤسسية (GeForce RTX 5090/4090، Hopper، Blackwell، NVIDIA DGX Spark، DGX Station، RTX PRO)؛ يُدعم التنسيق رباعي البت NVFP4 للتسريع. كما نُشر دليل المطور، ودليل مرئي، وبرنامج تعليمي للضبط الدقيق باستخدام Hackable Diffusion (JAX).
المصدر: Google DeepMind — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة