DeepSeek, R2 모델 암시 및 새로운 추론 스케일링 방법 SPCT 공개
DeepSeek은 일반 보상 모델의 추론 중 확장성을 개선하기 위해 SPCT(Self-Principled Critique Tuning) 방법을 제안하는 연구를 발표했습니다. 동시에, 회사는 순수 강화 학습 접근법을 기반으로 할 것으로 예상되는 차기 모델 R2의 출시를 암시했습니다.
DeepSeek
OpenAI
Synced28.07 · 00:03

