DeepSeek mengisyaratkan model R2 dan memperkenalkan metode penskalaan inferensi baru SPCT
DeepSeek telah menerbitkan studi yang mengusulkan metode Self-Principled Critique Tuning (SPCT) untuk meningkatkan skalabilitas model reward umum selama inferensi. Di saat yang sama, perusahaan mengisyaratkan akan segera merilis model terbarunya, R2, yang diperkirakan didasarkan pada pendekatan pembelajaran penguatan murni.
DeepSeek
OpenAI
