Google DiffusionGemma: تقرير فني يشرح نموذج نشر النصوص السريع
Google/DeepMind
NVIDIA
أصدرت Google DeepMind تقريرًا فنيًا حول DiffusionGemma، وهو نموذج نشر نصوص يولّد 256 رمزًا بالتوازي، ليصل إلى حوالي 1500 رمز في الثانية على وحدة معالجة الرسوميات Nvidia H100. تم إنشاء النموذج بتحويل نموذج Gemma 4 الحالي إلى نموذج نشر بأقل من 10% من ميزانية رموز التدريب الأصلية. يسلط التقرير الضوء على نقاط قوة النموذج، مثل التصحيح الذاتي، وحدوده في التفكير وإنتاجية المستخدمين المتعددين.
نشرت Google DeepMind تقريرًا فنيًا عن نموذج DiffusionGemma، وهو نموذج صدر في منتصف يونيو، يولّد النص عبر تنقيح كتل من 256 رمزًا بشكل متوازٍ، على غرار توليد الصور من الضوضاء. على مسرّع Nvidia H100، يحقق حوالي 1500 رمزًا في الثانية. بدلاً من التدريب من الصفر، تم تحويل النموذج الحالي Gemma-4-26B-A4B إلى نموذج انتشار باستخدام أقل من 10% من ميزانية الرموز التدريبية الأصلية. تضمن التدريب مرحلتين: أولاً، تعلم إعادة بناء كتل النص المشوشة، ثم مرحلة مدمجة من التعلم التعزيزي وتقطير العينات، والتي تسميها Google SD·RL. يذكر التقرير أن هذا يحسّن معايير الاستدلال بمتوسط عشر نقاط بينما يضاعف الرموز لكل خطوة تقريبًا أربع مرات، كما أن الاستجابات أقصر بنحو 50%. تسمح المعالجة ثنائية الاتجاه في DiffusionGemma بالتصحيح الذاتي قبل الإخراج، مما يمكنه من حل ألغاز سودوكو بدقة 85% بعد الضبط الدقيق، بينما يفشل النموذج الأساسي في ذلك. كما يحتفظ بالقدرة على التوليد كلمة بكلمة، مما يتيح للمستخدمين تبديل الأوضاع. ومع ذلك، فإن الأداء المطلق أقل من النموذج التوليدي التتابعي بسبب عوامل مثل التحويل اللاحق وفترة التدريب القصيرة الموجهة نحو السرعة. قد يقع النموذج أحيانًا في حلقات تكرارية وقد يفشل في إغلاق أقسام الاستدلال، مما يخفض درجات المعايير. تنطبق ميزة السرعة بشكل أساسي على السيناريوهات ذات المستخدم الواحد، حيث تلحق النماذج التوليدية التتابعية في الإنتاجية بعد 32 طلبًا متزامنًا. تضع Google نموذج DiffusionGemma كتجريبي، بهدف تسريع البحث وتوفير أساس للتكيفات المتخصصة. يُستخدم بالفعل من قبل الشركة الناشئة Interfaze للتعرف على الكلام متعدد اللغات وفي مشروع لتقارير الأشعة التفاعلية. يتوفر النموذج بموجب ترخيص Apache 2.0 على Hugging Face، وقد عُرض نموذج أولي، Gemini Diffusion، في مايو 2025.
المصدر: The Decoder (DE) —
الأصلي
