DeepSeek deutet R2-Modell an und stellt neue Inferenz-Skalierungsmethode SPCT vor
DeepSeek hat eine Studie veröffentlicht, die die Self-Principled Critique Tuning (SPCT)-Methode zur Verbesserung der Skalierbarkeit allgemeiner Belohnungsmodelle während der Inferenz vorschlägt. Gleichzeitig deutete das Unternehmen die bevorstehende Veröffentlichung seines nächsten Modells R2 an, das voraussichtlich auf Ansätzen des reinen bestärkenden Lernens basieren wird.
DeepSeek
OpenAI


