DeepSeek hé lộ mô hình R2 và giới thiệu phương pháp mở rộng suy luận mới SPCT
DeepSeek đã công bố một nghiên cứu đề xuất phương pháp Self-Principled Critique Tuning (SPCT) nhằm cải thiện khả năng mở rộng của các mô hình phần thưởng tổng quát trong quá trình suy luận. Đồng thời, công ty hé lộ về việc sắp ra mắt mô hình tiếp theo, R2, dự kiến dựa trên các phương pháp học tăng cường thuần túy.
DeepSeek
OpenAI
Synced28.07 · 00:03

