PesquisaModelos 🇨🇳 09.08.2026 08:01

Quando os Bancos de Questões Não Acompanham, a IA Começa a Definir Seus Próprios Problemas: A Equipe Endless Frontier Explora o RSI no Nível de Dados

DP TechnologyDP Technology DeepSeekDeepSeek
Uma equipe chinesa da Universidade Jiao Tong de Xangai, DP Technology e Instituto de Inovação de Algoritmos de Xangai lançou o BigBang-V1, o primeiro modelo base treinado nativamente usando autoaperfeiçoamento recursivo. O modelo de 35B parâmetros, com 100% de dados de treinamento sintetizados por IA, supera modelos de trilhões de parâmetros em vários benchmarks científicos, demonstrando um pipeline de dados auto-evolutivo.
A equipe Endless Frontier, composta por pesquisadores do Instituto de IA da Universidade Jiao Tong de Xangai, da DP Technology e do Instituto de Inovação em Algoritmos de Xangai, lançou o BigBang-V1, o primeiro modelo base treinado nativamente usando autoaprimoramento recursivo (RSI). Nessa abordagem, a IA lida com geração, resolução e verificação de problemas, produzindo dados sintéticos autoevolutivos de alta qualidade sem envolvimento humano por tarefa. O modelo, com 35B de parâmetros e cerca de 3B ativos durante a inferência, suporta um contexto longo de 262K e é inteiramente treinado em dados sintetizados por IA, focados em tarefas de ciência de fronteira. Ele alcançou 10 primeiros lugares entre modelos de 35B em benchmarks, incluindo busca de horizonte longo, codificação, pesquisa científica e pesquisa de IA, e até superou o DeepSeek V4 Pro Preview, de 1T de parâmetros, em tarefas científicas difíceis, como FrontierScience Research e PaperBench. Exemplos de sua capacidade incluem localizar com precisão um local de inserção de transposon usando evidências de junção e replicar um artigo em código executável, autocorrigindo-se durante testes de fumaça. A equipe enfatiza que o sistema de produção de dados em si pode ser otimizado, exigindo tarefas que sejam tanto de fronteira quanto verificáveis, e eles implementam um pipeline de duplo loop: um loop interno com agentes Generator e Critic que produzem e verificam dados, e um loop externo impulsionado por resultados reais de treinamento para calibrar o sistema. Esse loop de RSI em nível de dados previne o colapso de dados sintéticos, enquanto os humanos ainda definem metas, orçamentos, riscos e critérios de aceitação. O modelo e o código são de código aberto no Hugging Face e no GitHub.
Fonte: QbitAI 量子位 — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas