а полные доказательства объединяются с рассуждениями цепочки мыслей (chain-of-thought) от DeepSeek-V3 для обучения. Дальнейшая оптимизация модели осуществляется с помощью обучения с подкреплением на основе бинарной обратной связи. Версия с 671 миллиардом (671B) параметров достигает 88,9% на тесте MiniF2F-test и решает 49 из 658 задач PutnamBench. Также DeepSeek представила ProverBench — набор данных из 325 задач из соревнований AIME и учебников для оценки математических рассуждений. Модель доступна в двух размерах: 7 миллиардов (7B) и 671 миллиард (671B) параметров.