मॉडलओपन सोर्स 🇺🇸 27.07.2026 12:02

DiffusionGemma: 4 गुना तेज़ टेक्स्ट जनरेशन

Google/DeepMindGoogle/DeepMind DeepMindDeepMind NVIDIANVIDIA
गूगल डीपमाइंड ने DiffusionGemma पेश किया है, जो एक प्रायोगिक ओपन 26B मिक्सचर ऑफ एक्सपर्ट्स मॉडल है जो टेक्स्ट डिफ्यूजन का उपयोग करके GPU पर ऑटोरेग्रेसिव LLM से 4 गुना तेज़ जनरेशन करता है। यह 256-टोकन ब्लॉक को एक साथ प्रोसेस करता है, जिसका लक्ष्य स्पीड-क्रिटिकल लोकल वर्कफ़्लो जैसे इन-लाइन एडिटिंग है, और इसे हगिंग फेस पर अपाचे 2.0 के तहत जारी किया गया है।
Google DeepMind ने DiffusionGemma जारी किया है, जो Apache 2.0 लाइसेंस के तहत एक प्रायोगिक 26B पैरामीटर वाला मिक्सचर ऑफ एक्सपर्ट्स (मोए) मॉडल है, जो अनुक्रमिक टोकन भविष्यवाणी के बजाय डिफ्यूजन-आधारित दृष्टिकोण का उपयोग करके 4 गुना तक तेज़ टेक्स्ट जनरेशन प्राप्त करता है। मॉडल प्रति इन्फ्रेंस केवल 3.8B पैरामीटर सक्रिय करता है, जो क्वांटाइज़ होने पर 18GB वीआरएएम में फिट होता है, और NVIDIA H100 पर प्रति सेकंड 1000 से अधिक टोकन तथा GeForce RTX 5090 पर 700 से अधिक टोकन प्राप्त करता है। यह समानांतर में 256 टोकन उत्पन्न करने के लिए द्वि-दिशात्मक ध्यान का उपयोग करता है, जिससे कोड इनफ़िलिंग और सुडोकू हल करने जैसे गैर-रैखिक कार्य संभव होते हैं। DiffusionGemma स्थानीय कम-समवर्ती इन्फ्रेंस के लिए अनुकूलित है, जहां इसकी समानांतर डिकोडिंग अधिकतम लाभ प्रदान करती है, जबकि उच्च क्यूपीएस क्लाउड सर्विंग के लिए ऑटोरेग्रेसिव मॉडल बेहतर बने रहते हैं। मॉडल अपने आउटपुट को पुनरावृत्त रूप से परिष्कृत करता है, और इसे Unsloth, Hugging Face, vLLM, MLX, JAX, NVIDIA NeMo जैसे टूल का उपयोग करके फाइन-ट्यून किया जा सकता है, जिसमें llama.cpp समर्थन आने वाला है। Google DeepMind ने NVFP4 कर्नेल सहित हार्डवेयर अनुकूलन के लिए NVIDIA के साथ सहयोग किया, और मॉडल Hugging Face, Gemini Enterprise Agent Platform और NVIDIA NIM पर उपलब्ध है।
स्रोत: Google DeepMind — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार