DeepSeek, R2 modeline işaret ediyor ve yeni çıkarım ölçekleme yöntemi SPCT'yi tanıtıyor
DeepSeek, genel ödül modellerinin çıkarım sırasında ölçeklenebilirliğini iyileştirmek için Kendi Kendini İlkeli Eleştiri Ayarlama (Self-Principled Critique Tuning - SPCT) yöntemini öneren bir çalışma yayınladı. Aynı zamanda şirket, saf pekiştirmeli öğrenme yaklaşımlarına dayanması beklenen bir sonraki modeli R2'nin yakında çıkacağını ima etti.
DeepSeek
OpenAI
Synced28.07 · 00:03

