इल्या का पहला मॉडल सामने आया: एसएसआई का टेस्ट-टाइम ट्रेनिंग इंजन
OpenAI
NVIDIA
एक लीक से पता चलता है कि इल्या सुत्स्केवर की स्टार्टअप एसएसआई टेस्ट-टाइम ट्रेनिंग (टीटीटी) पर आधारित एक छोटा रीजनिंग इंजन विकसित कर रही है, जो अगस्त तक जारी हो सकता है। क्यूरेटेड डेटा पर प्रशिक्षित यह मॉडल सीखने का तरीका सीखता है, और अनुमान के दौरान अपने वेट्स को अपडेट करता है, जिससे यह बड़े मॉडलों से मुकाबला कर सकता है। यह इल्या के सतत सीखने पर सार्वजनिक विचारों और एनवीडिया के एसएसआई में हालिया निवेश के अनुरूप है।
X पर 'थ्री स्ट्रॉबेरीज़' नामक उपयोगकर्ता द्वारा किए गए एक लीक में दावा किया गया है कि इल्या सुत्सकेवर के स्टार्टअप एसएसआई (SSI) टेस्ट-टाइम ट्रेनिंग (TTT) पर आधारित एक छोटे रीज़निंग इंजन की खोज कर रहा है। यह मॉडल विशेष रूप से तैयार किए गए डेटा का उपयोग करके सीखना सीखता है, फिर समस्या-समाधान के दौरान आंशिक वज़न अपडेट करता है, जिससे एक छोटा मॉडल भी बड़े मॉडलों के साथ प्रतिस्पर्धा कर सकता है। लीक करने वाले का सुझाव है कि वर्तमान संस्करण तैयार है और अगला संस्करण दस गुना स्केल किया जाएगा, वर्तमान संस्करण संभवतः अगस्त की शुरुआत में सीमित संख्या में उपयोगकर्ताओं के लिए शुरू हो सकता है। यह इल्या के पिछले बयानों के अनुरूप है, जिन्होंने निरंतर सीखने और एजीआई (AGI) के बारे में बात की थी, उनका विश्वास कि सुपरइंटेलिजेंस को तैनाती के बाद सीखना चाहिए, और एनवीडिया (Nvidia) द्वारा हाल ही में एसएसआई के साथ रणनीतिक साझेदारी और निवेश की घोषणा, जिसने एसएसआई की कंप्यूट शक्ति को दस गुना बढ़ा दिया। टीटीटी दृष्टिकोण पारंपरिक संदर्भ विस्तार के विपरीत है, क्योंकि यह संदर्भ को प्रशिक्षण डेटा के रूप में मानता है, जिससे मॉडल अनुमान के दौरान खुद को बदल सकता है, हालांकि यह सुरक्षा संबंधी चिंताएं उठाता है, जिन्हें लीक करने वाले का दावा है कि इल्या ने संबोधित किया है। 2024 में स्थापित एसएसआई गोपनीय रहा है, लेकिन यह लीक एक संभावित सफलता का संकेत देता है। खबर में 'एंड-टू-एंड टेस्ट-टाइम ट्रेनिंग फॉर लॉन्ग कॉन्टेक्स्ट' नामक एक शोध पत्र का भी संदर्भ दिया गया है, जो संबंधित कार्य है।
स्रोत: QbitAI 量子位 —
मूल
