Grok 4.6 जारी: कैसे मॉडल ने आधी कीमत पर GPT-5.6 स्तर हासिल किया

AnthropicAnthropic OpenAIOpenAI Moonshot AIMoonshot AI
SpaceXAI ने Grok 4.6 जारी किया, जो कंपनी के अनुसार बाज़ार के सबसे शक्तिशाली मॉडलों के स्तर को आधी कीमत पर मेल खाता है: $2 प्रति मिलियन इनपुट टोकन और $6 प्रति मिलियन आउटपुट टोकन। मॉडल आर्टिफिशियल एनालिसिस के इंटेलिजेंस इंडेक्स पर 61 स्कोर करता है, जो GPT-5.6 Sol के बराबर है, और यह पहले से ही Grok Build, Cursor, Grok Bot और API के माध्यम से उपलब्ध है।
SpaceXAI ने Grok 4.6 पेश किया, जिसका दावा है कि यह प्रतिस्पर्धियों की आधी लागत पर सबसे मजबूत मॉडल के स्तर तक पहुंचता है: कीमत $2 प्रति मिलियन इनपुट टोकन और $6 प्रति मिलियन आउटपुट टोकन है। मॉडल पहले से ही Grok Build एजेंट, Cursor, Grok Bot और API के माध्यम से उपलब्ध है, जिसमें Cursor और Grok Build में पहले सप्ताह के लिए दोगुनी उपयोग सीमाएं हैं। प्रमुख आंकड़ा स्वतंत्र एनालिटिक्स प्लेटफॉर्म Artificial Analysis के इंटेलिजेंस इंडेक्स पर 61 अंक है, जो नौ बेंचमार्क को समेकित करता है। यह अधिकतम रीजनिंग मोड में GPT-5.6 Sol के बराबर है, Claude Fable 5 Max से एक अंक कम है, और एक महीने पहले के Grok 4.5 से 5 अंक अधिक है। विश्लेषकों का कहना है कि SpaceXAI इंटेलिजेंस की सीमा पर लौट आया है, केवल Anthropic आगे है। विस्तृत बेंचमार्क पर, Grok 4.6 कार्यालय ज्ञान कार्य के लिए GDPVal-AA v2 में 1753 अंकों के साथ आगे है, जबकि Fable 5 के 1741 और Sol के 1728 अंक हैं, और AA-Briefcase में 1577 बनाम 1574 और 1502। यह कानूनी Harvey LAB में भी शीर्ष पर है, 15.8% बनाम Fable 5 के 11.3% और Sol के 2.5%। हालांकि, यह Terminal-Bench v3.0 पर काफी पीछे है: 26% बनाम Sol के 34.6% और Fable 5 के 34.1%, लेकिन पुराने v2.1 संस्करण पर यह 88.4% स्कोर करता है, जो Claude Opus 5 के बाद दूसरा है। यह कुछ कोडिंग बेंचमार्क पर भी हारता है: DeepSWE पर यह Sol (73%) और Fable 5 (70%) से पीछे है, और FrontierCode और APEX-SWE पर यह Fable 5 से हारता है। सबसे दिलचस्प पहलू यह है कि समानता कैसे हासिल की गई: मस्क के अनुसार, Grok 4.6 Grok 4.5 के समान 1.5 ट्रिलियन पैरामीटर बेस पर बनाया गया है, इसलिए मॉडल बड़ा नहीं हुआ। स्केलिंग के बजाय, कंपनी ने तर्क और इंजीनियरिंग विषयों पर क्यूरेटेड सिंथेटिक डेटा और बेहतर ऑप्टिमाइज़र के साथ उसी बेस पर एक और लंबा प्रशिक्षण चक्र चलाया, फिर SFT और RL चरणों का पुनर्निर्माण किया। SFT ट्रैजेक्ट्रीज़ को Grok 4.5 द्वारा ही पुनः उत्पन्न किया गया, मॉडल जांच के साथ समस्याग्रस्त उदाहरणों को फ़िल्टर करते हुए—प्रभावी रूप से, पिछले संस्करण ने अगले को प्रशिक्षित किया। अब SpaceXAI के स्वामित्व वाले Cursor में, वे ध्यान देते हैं कि Grok 4.6 विचार विवरण के आधार पर पहले पास में ऐप की संरचना और दृश्य भाषा बनाता है, और लंबी ट्रैजेक्ट्रीज़ पर यह काफी अधिक आत्म-जांच दिखाता है: यह आगे बढ़ने से पहले अपने काम का परीक्षण करता है। प्रशिक्षण के दौरान RL कार्यों में कम्प्यूटेशनल कर्नेल को अनुकूलित करने से लेकर वेब विकास और CAD तक शामिल थे। अर्थव्यवस्था Grok 4.5 से बनी हुई है, जो 8 जुलाई को जारी हुई थी: वही $2/$6, जो Artificial Analysis के अनुसार Claude Opus 5 ($5/$25) और GPT-5.6 Sol ($5/$30) से 60% से अधिक कम है। इंटेलिजेंस इंडेक्स कार्य की लागत मॉडल के लिए $0.84 है, Kimi K3 के समान, लेकिन थोड़ी अधिक बुद्धि के साथ, इसे बुद्धि बनाम मूल्य के पारेटो फ्रंटियर पर सटीक रूप से रखता है। इसकी विशिष्ट टोकन दक्षता बनी हुई है: AA-Briefcase पर, Grok 4.6 एक लंबे एजेंटिक कार्य को औसतन 53 टर्न और आधा बिलियन इनपुट टोकन में पूरा करता है, बनाम Claude Opus 5 के 103 टर्न और दो बिलियन। केवल कैश हिट बढ़े, $0.3 से $0.5 प्रति मिलियन। SpaceXAI की रिलीज़ गति मजबूत है: Grok 4.5 ने 8 जुलाई को शुरुआत की, Grok 4.6 ने 12 अगस्त को, और Grok 4.7 जिसमें 2.1 ट्रिलियन पैरामीटर हैं, मस्क ने अगस्त कॉल पर अनुमान लगाया कि तीन से चार सप्ताह दूर है, यानी गर्मियों के अंत तक। Cursor की खरीद और पहले लॉन्च किए गए Grok Bot एजेंट के साथ, Grok एक मीम से एक उत्पाद लाइन में बदल रहा है जिसमें अपना विकास वातावरण, एजेंट और मॉडल पाइपलाइन है।
स्रोत: Habr — хаб ML — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार