Gemini Flash 3.6: ज्यादा स्मार्ट नहीं, लेकिन काफी सस्ता

Google/DeepMindGoogle/DeepMind
गूगल ने तीन मॉडल जारी किए: Gemini 3.6 Flash (मुख्य), Gemini 3.5 Flash-Lite (तेज़/सस्ता), और Gemini 3.5 Flash Cyber (सुरक्षा, प्रतिबंधित)। मुख्य सुधार समान कार्यों के लिए आउटपुट टोकन में 17% की कमी है, जो एजेंटिक परिदृश्यों में 31-71% की लागत बचत में तब्दील होती है। हालांकि, मॉडल की विज़ुअल पार्सिंग में गिरावट आई है, खासकर चार्ट पर। Gemini 3.5 Flash-Lite एक आश्चर्यजनक मूल्य नेता है, जो कभी-कभी पुराने मिड-टियर मॉडल से बेहतर प्रदर्शन करता है। गूगल ने Gemini 3.5 Pro के आंतरिक परीक्षण और Gemini 4 प्री-ट्रेनिंग की शुरुआत की भी घोषणा की।
21 जुलाई को Google ने तीन मॉडल जारी किए: Gemini 3.6 Flash (3.5 Flash की जगह, मूल्य $1.50/$7.50 प्रति मिलियन टोकन), Gemini 3.5 Flash-Lite (अति-त्वरित और सस्ता, $0.30/$2.50 प्रति मिलियन टोकन), और Gemini 3.5 Flash Cyber (भेद्यता खोज के लिए, केवल सरकारी उपयोग हेतु)। Artificial Analysis के अनुसार, मुख्य आंकड़ा 3.5 Flash की तुलना में आउटपुट टोकन में 17% की कमी है, जो DeepSWE कोडिंग बेंचमार्क पर 65% बचत (97k टोकन बनाम 276k टोकन) तक पहुँचती है। समग्र बुद्धिमत्ता सूचकांक (50 अंक) अपरिवर्तित है। बेंचमार्क पर, 3.6 Flash ने DeepSWE (37%→49%), MLE-Bench (49.7%→63.9%), OSWorld-Verified (78.4%→83.0%), और लॉन्ग-कॉन्टेक्स्ट रिकॉल (~27%→54%) में सुधार किया, लेकिन शुद्ध कोडिंग (SWE-Bench Pro 58.7% बनाम 64.7%) और ज्ञान कार्यों (GDPval-AA Elo 1421 बनाम Sonnet 5 के लिए 1607) में Grok 4.5 और Claude Sonnet 5 जैसे शीर्ष प्रतिस्पर्धियों से पीछे रह गया। एक उल्लेखनीय गिरावट: LlamaIndex के सीईओ Jerry Liu ने पाया कि ParseBench चार्ट पढ़ने की क्षमता 45% से घटकर 31% हो गई, और दस्तावेज़ स्कोर 69.9 से गिरकर 66.8 हो गए, संभवतः कोड/एजेंटों पर पोस्ट-ट्रेनिंग फोकस के कारण यह व्यापार-बंद है। Flash-Lite मॉडल मूल्य में उत्कृष्ट है: 350 टोकन/सेकंड आउटपुट, कुछ परीक्षणों में पुराने Gemini 3 Flash से बेहतर (SWE-Bench Pro 54.2% बनाम 49.6%, OSWorld-Verified 74.0% बनाम 65.1%) और Claude Haiku 4.5 से सस्ता। Flash Cyber, 3.5 Flash पर आधारित, ने Chrome V8 पर 55 अद्वितीय समस्याएं पाईं (बेस के लिए 47, Claude Opus 4.6 के लिए 36 की तुलना में) और CyberGym बेंचमार्क पर 83.2% स्कोर किया (विशेष मॉडलों में चौथा)। Google ने भागीदारों के साथ Gemini 3.5 Pro के आंतरिक परीक्षण और Gemini 4 प्री-ट्रेनिंग की शुरुआत का भी उल्लेख किया।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार