DeepSeek намекает на модель R2 и представляет новый метод масштабирования инференса SPCT
DeepSeek
OpenAI
Компания DeepSeek AI опубликовала статью о масштабировании на этапе инференса для общих моделей вознаграждения, представив SPCT (Self-Principled Critique Tuning — настройка критики на основе собственных принципов). Компания намекает на свою предстоящую модель R2. Исследование решает проблему разреженности вознаграждения и направлено на улучшение масштабируемости моделей вознаграждения во время инференса.
Компания DeepSeek AI опубликовала статью под названием «Inference-Time Scaling for Generalist Reward Modeling», в которой представлен новый метод — Self-Principled Critique Tuning (SPCT, настройка на основе самогенерируемых принципов и критики). SPCT улучшает общие модели вознаграждения (General Reward Models, GRMs) за счет динамической генерации принципов и критики с помощью отвергающей тонкой
Показать ещё ↓
Источник: Synced —
оригинал
