DeepSeek ने R2 मॉडल का संकेत दिया और नई इन्फ्रेंस स्केलिंग विधि SPCT पेश की
DeepSeek ने एक अध्ययन प्रकाशित किया है जिसमें Self-Principled Critique Tuning (SPCT) विधि प्रस्तावित की गई है, जो इन्फ्रेंस के दौरान सामान्य रिवॉर्ड मॉडल की स्केलेबिलिटी में सुधार करती है। साथ ही, कंपनी ने अपने अगले मॉडल R2 के आगामी रिलीज़ का संकेत दिया है, जो शुद्ध रीइन्फोर्समेंट लर्निंग दृष्टिकोणों पर आधारित होने की उम्मीद है।
DeepSeek
OpenAI
