DeepSeek AI는 일반 보상 모델을 위한 추론 시간 스케일링에 관한 논문을 발표하며 SPCT(Self-Principled Critique Tuning)를 소개했습니다. 회사는 곧 출시될 R2 모델을 암시했습니다. 이 연구는 보상 희소성을 해결하고 추론 중 보상 모델의 확장성을 개선하는 것을 목표로 합니다.
마이크로소프트 CEO 사티아 나델라는 독점 AI 연구소의 모델에만 의존하는 기업은 데이터와 사고에 대한 통제권을 잃을 위험이 있으며 살아남지 못할 수 있다고 경고합니다. 그는 기업이 자체 모델을 훈련하거나 오픈 모델을 사용하기 위해 메타데이터를 유지하고, AI 에이전트 인프라를 모델 제공업체와 분리할 것을 조언합니다.