Google DeepMind ने पेश किया Gemma 4 12B: बिना एनकोडर के एकीकृत मल्टीमॉडल मॉडल
Google/DeepMind
Google DeepMind
Google DeepMind ने Gemma 4 12B का अनावरण किया, जो एक मध्यम आकार का मल्टीमॉडल AI मॉडल है जो बिना अलग एनकोडर के सीधे विज़न और ऑडियो प्रोसेस करता है। इसे 16GB रैम वाले लैपटॉप पर चलाने के लिए डिज़ाइन किया गया है और यह उन्नत रीज़निंग और एजेंटिक क्षमताएं प्रदान करता है। मॉडल Apache 2.0 लाइसेंस के तहत जारी किया गया है और यह Hugging Face, Ollama और Google Cloud जैसे डेवलपर टूल्स का समर्थन करता है।
गूगल डीपमाइंड ने जेम्मा 4 12B की घोषणा की, यह एक एकीकृत मल्टीमॉडल मॉडल है जिसमें विज़न और ऑडियो इनपुट के लिए समर्पित एन्कोडर नहीं हैं, जिससे एलएलएम बैकबोन द्वारा सीधे प्रसंस्करण संभव होता है। इसे 16GB वीआरएएम या यूनिफाइड मेमोरी वाले उपभोक्ता लैपटॉप पर स्थानीय रूप से चलाने के लिए डिज़ाइन किया गया है, और यह बड़े 26B MoE मॉडल के करीब प्रदर्शन देता है, लेकिन छोटे मेमोरी फुटप्रिंट के साथ। मुख्य विशेषताओं में मूल ऑडियो इनपुट, कम विलंबता के लिए मल्टी-टोकन प्रेडिक्शन ड्राफ्टर और अपाचे 2.0 लाइसेंस शामिल हैं। यह मॉडल हगिंग फेस और कैगल पर डाउनलोड के लिए उपलब्ध है, और एलएम स्टूडियो, ओलामा और गूगल क्लाउड जैसे टूल्स के साथ एकीकरण का समर्थन करता है। जेम्मा 4 मॉडलों ने 150 मिलियन डाउनलोड पार कर लिए हैं।
स्रोत: Google DeepMind —
मूल
