Google का DiffusionGemma: तेज़ टेक्स्ट डिफ्यूज़न मॉडल पर तकनीकी रिपोर्ट
Google/DeepMind
NVIDIA
Google DeepMind ने DiffusionGemma पर एक तकनीकी रिपोर्ट जारी की है, जो एक टेक्स्ट डिफ्यूज़न मॉडल है जो 256 टोकन समानांतर रूप से उत्पन्न करता है, और Nvidia H100 पर प्रति सेकंड लगभग 1,500 टोकन तक पहुँचता है। यह मॉडल मौजूदा Gemma 4 मॉडल को डिफ्यूज़न मॉडल में परिवर्तित करके बनाया गया है, जिसमें मूल प्रशिक्षण टोकन बजट का 10% से भी कम उपयोग किया गया है। रिपोर्ट में मॉडल की ताकत, जैसे स्व-सुधार, और इसकी सीमाएँ, जैसे तर्क और बहु-उपयोगकर्ता थ्रूपुट में कमियाँ, दोनों पर प्रकाश डाला गया है।
Google DeepMind ने DiffusionGemma के लिए एक तकनीकी रिपोर्ट प्रकाशित की है, जो मध्य जून में जारी एक मॉडल है जो 256 टोकन के ब्लॉक को समानांतर में परिष्कृत करके पाठ उत्पन्न करता है, जैसे छवि निर्माण शोर से होता है। Nvidia के H100 त्वरक पर, यह प्रति सेकंड लगभग 1,500 टोकन प्राप्त करता है। शुरू से प्रशिक्षण के बजाय, मौजूदा Gemma-4-26B-A4B मॉडल को मूल प्रशिक्षण टोकन बजट के 10% से कम का उपयोग करके एक प्रसार मॉडल में परिवर्तित किया गया था। प्रशिक्षण में दो चरण शामिल थे: पहले, शोर पाठ ब्लॉकों का पुनर्निर्माण सीखना, फिर सुदृढीकरण सीखने और सैम्पलर आसवन का एक संयुक्त चरण, जिसे Google SD·RL कहता है। रिपोर्ट में कहा गया है कि यह तर्क बेंचमार्क में औसतन दस अंकों में सुधार करता है जबकि प्रति चरण टोकन लगभग चार गुना बढ़ाता है, और प्रतिक्रियाएं लगभग 50% छोटी होती हैं। DiffusionGemma की द्विदिश प्रसंस्करण आउटपुट से पहले स्व-सुधार की अनुमति देती है, जिससे यह फाइन-ट्यूनिंग के बाद 85% सटीकता के साथ सुडोकू पहेली हल कर सकता है, जबकि आधार मॉडल विफल रहता है। यह शब्द-दर-शब्द उत्पन्न करने की क्षमता भी बनाए रखता है, जिससे उपयोगकर्ता मोड बदल सकते हैं। हालांकि, पूर्ण प्रदर्शन ऑटोरेग्रेसिव मॉडल से कम है, जैसे पोस्ट-हॉक रूपांतरण और गति के उद्देश्य से छोटे प्रशिक्षण चरण जैसे कारकों के कारण। मॉडल कभी-कभी दोहराव लूप में पड़ सकता है और तर्क अनुभागों को बंद करने में विफल हो सकता है, जिससे बेंचमार्क स्कोर कम हो सकता है। गति लाभ मुख्य रूप से एकल-उपयोगकर्ता परिदृश्यों में लागू होता है, क्योंकि ऑटोरेग्रेसिव मॉडल 32 से अधिक समवर्ती अनुरोधों से परे थ्रूपुट में पकड़ बनाते हैं। Google DiffusionGemma को प्रयोगात्मक के रूप में रखता है, जिसका उद्देश्य अनुसंधान को गति देना और विशेष अनुकूलन के लिए आधार प्रदान करना है। यह पहले से ही स्टार्टअप Interfaze द्वारा बहुभाषी भाषण पहचान के लिए और इंटरैक्टिव रेडियोलॉजी रिपोर्ट के लिए एक परियोजना में उपयोग किया जा रहा है। मॉडल Hugging Face पर Apache 2.0 के तहत उपलब्ध है, और एक अग्रदूत, Gemini Diffusion, मई 2025 में प्रदर्शित किया गया था।
स्रोत: The Decoder (DE) —
मूल
