DeepSeek hé lộ mô hình R2 và giới thiệu phương pháp mở rộng suy luận mới SPCT
DeepSeek
OpenAI
DeepSeek AI đã công bố một bài báo về mở rộng thời gian suy luận cho các mô hình phần thưởng tổng quát, giới thiệu SPCT (Self-Principled Critique Tuning - tinh chỉnh phê bình dựa trên nguyên tắc tự động). Công ty hé lộ mô hình R2 sắp ra mắt. Nghiên cứu này giải quyết vấn đề thưa thớt phần thưởng và nhằm cải thiện khả năng mở rộng của các mô hình phần thưởng trong quá trình suy luận.
DeepSeek AI đã công bố một bài báo có tiêu đề 'Inference-Time Scaling for Generalist Reward Modeling', giới thiệu một phương pháp mới có tên là Self-Principled Critique Tuning (SPCT). SPCT cải thiện các mô hình phần thưởng tổng quát (GRM - general reward models) bằng cách tạo ra động các nguyên tắc và phê bình thông qua tinh chỉnh loại bỏ và học tăng cường trực tuyến dựa trên quy tắc. Cách tiếp cận này nhằm cải thiện khả năng mở rộng trong suốt quá trình suy luận, giải quyết vấn đề thưa thớt phần thưởng - một rào cản lớn trong việc mở rộng học tăng cường cho các mô hình ngôn ngữ lớn (LLM - large language models). Dòng R1 của DeepSeek đã xác nhận hiệu quả của việc huấn luyện học tăng cường thuần túy; công ty hiện gợi ý về mô hình thế hệ tiếp theo R2, dự kiến sẽ xây dựng dựa trên những tiến bộ này. Sự dịch chuyển trong việc mở rộng quy mô LLM từ tiền huấn luyện sang hậu huấn luyện, đặc biệt là giai đoạn suy luận, theo sau các mô hình như o1 của OpenAI, vốn sử dụng suy luận chuỗi suy nghĩ nội bộ sâu rộng.
Nguồn: Synced —
bản gốc
