शोधमॉडल 🇺🇸 28.07.2026 00:03

DeepSeek ने R2 मॉडल का संकेत दिया और नई इंफ़रेंस स्केलिंग विधि SPCT पेश की

DeepSeekDeepSeek OpenAIOpenAI
DeepSeek AI ने सामान्य रिवॉर्ड मॉडल के लिए इंफ़रेंस-टाइम स्केलिंग पर एक पेपर प्रकाशित किया है, जिसमें SPCT (Self-Principled Critique Tuning) शुरू किया गया है। कंपनी अपने आगामी R2 मॉडल का संकेत देती है। यह शोध रिवॉर्ड स्पार्सिटी को संबोधित करता है और इंफ़रेंस के दौरान रिवॉर्ड मॉडल की स्केलेबिलिटी में सुधार लाने का लक्ष्य रखता है।
दीपसीक AI ने 'इन्फ़रेंस-टाइम स्केलिंग फ़ॉर जनरलिस्ट रिवॉर्ड मॉडलिंग' शीर्षक से एक पेपर प्रकाशित किया, जिसमें सेल्फ-प्रिंसिपल्ड क्रिटिक ट्यूनिंग (SPCT) नामक एक नई विधि पेश की गई है। SPCT गतिशील रूप से सिद्धांतों और आलोचनाओं को रिजेक्शन फ़ाइन-ट्यूनिंग और नियम-आधारित ऑनलाइन रीइन्फ़ोर्समेंट लर्निंग के माध्यम से उत्पन्न करके सामान्य पुरस्कार मॉडल (GRMs) को बढ़ाता है। इस दृष्टिकोण का उद्देश्य अनुमान के दौरान मापनीयता में सुधार करना है, जो LLMs के लिए रीइन्फ़ोर्समेंट लर्निंग को स्केल करने में एक प्रमुख बाधा यानी पुरस्कार विरलता को संबोधित करता है। दीपसीक की R1 श्रृंखला ने पहले ही शुद्ध RL प्रशिक्षण को मान्य किया; कंपनी अब अगली पीढ़ी के R2 मॉडल का संकेत दे रही है, जिससे इन प्रगति पर निर्माण करने की उम्मीद है। LLM स्केलिंग में प्री-ट्रेनिंग से पोस्ट-ट्रेनिंग की ओर बदलाव, विशेष रूप से अनुमान चरण, OpenAI के o1 जैसे मॉडलों का अनुसरण करता है, जो व्यापक आंतरिक चेन-ऑफ-थॉट तर्क का उपयोग करता है।
स्रोत: Synced — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार