연구모델 🇺🇸 28.07.2026 00:03

DeepSeek, R2 모델 암시 및 새로운 추론 스케일링 방법 SPCT 도입

DeepSeekDeepSeek OpenAIOpenAI
DeepSeek AI는 일반 보상 모델을 위한 추론 시간 스케일링에 관한 논문을 발표하며 SPCT(Self-Principled Critique Tuning)를 소개했습니다. 회사는 곧 출시될 R2 모델을 암시했습니다. 이 연구는 보상 희소성을 해결하고 추론 중 보상 모델의 확장성을 개선하는 것을 목표로 합니다.
딥시크 AI는 '추론 시간 스케일링을 위한 범용 보상 모델링'이라는 제목의 논문에서 자체 원칙 비평 조정(SPCT)이라는 새로운 방법을 발표했습니다. SPCT는 거부 미세 조정과 규칙 기반 온라인 강화 학습을 통해 동적으로 원칙과 비평을 생성함으로써 범용 보상 모델(GRM)을 향상시킵니다. 이 접근 방식은 추론 중 확장성을 개선하여, 거대 언어 모델(LLM)을 위한 강화 학습 확장의 주요 장애물인 보상 희소성을 해결하는 것을 목표로 합니다. 딥시크의 R1 시리즈는 이미 순수 강화 학습 훈련을 검증했으며, 회사는 이러한 발전을 바탕으로 한 차세대 R2 모델을 암시하고 있습니다. 프리트레이닝에서 포스트 트레이닝, 특히 추론 단계로의 LLM 확장 변화는 광범위한 내부 사고 사슬 추론을 사용하는 오픈에이아이의 o1과 같은 모델을 따릅니다.
출처: Synced — 원문
관련 게시물 ↓
새로운 뉴스