⚡ ÚLTIMA HORA
DeepSeek lança DeepSeek-Prover-V2 com busca recursiva de provas e novo benchmark ProverBench
DeepSeek
A DeepSeek AI lançou o DeepSeek-Prover-V2, um modelo de linguagem grande de código aberto para prova formal de teoremas no Lean 4. Ele usa um pipeline recursivo para gerar dados de treinamento via DeepSeek-V3, alcança resultados de ponta no MiniF2F e PutnamBench, e introduz o ProverBench, um novo benchmark com 325 problemas.
A DeepSeek AI anunciou o DeepSeek-Prover-V2, um modelo de linguagem grande de código aberto para demonstração formal de teoremas em Lean 4. O modelo emprega um pipeline recursivo de demonstração de teoremas que utiliza o DeepSeek-V3 para gerar dados de inicialização de alta qualidade, decompondo teoremas complexos em subobjetivos e formalizando-os. Um modelo de 7 bilhões de parâmetros então demonstra esses subobjetivos, e as demonstrações completas são pareadas com o raciocínio encadeado do DeepSeek-V3 para treinamento. O aprendizado por reforço com feedback binário refina ainda mais o modelo. A versão de 671 bilhões de parâmetros alcança 88,9% no MiniF2F-test e resolve 49 dos 658 problemas do PutnamBench. A DeepSeek também introduziu o ProverBench, um conjunto de dados de 325 problemas de competições AIME e livros didáticos para avaliar o raciocínio matemático. O modelo está disponível em dois tamanhos: 7 bilhões e 671 bilhões de parâmetros.
Fonte: Synced —
original
