Código AbertoPesquisa 🇺🇸 26.07.2026 15:02

Open Dreamer: Implementação Open-Source do Pipeline Dreamer 4 em JAX/Flax com Receita Completa de Treinamento

Uma equipe de pesquisadores de IA lançou o Open Dreamer, uma implementação open-source do pipeline de modelo mundial Dreamer 4 construído com JAX e Flax NNX. O projeto inclui um pipeline de treinamento, um mecanismo de inferência local e uma demonstração em navegador que gera um mundo do Minecraft em tempo real. O modelo usa um backbone transformer com atenção causal em blocos, alcança 57-58% de utilização dos FLOPs do modelo, e a equipe enfatiza que a estabilidade foi o principal desafio, não a taxa de transferência.
Os pesquisadores Francesco Sacco, Diego Martí e Edward Hu, patrocinados pela Reactor, lançaram o Open Dreamer, uma implementação aberta do Dreamer 4 em JAX/Flax NNX. Dois repositórios foram disponibilizados: um para treinamento (tokenizador, modelo de dinâmica, rollout, pontuação FVD) e outro para inferência local. Uma demonstração no navegador transmite um mundo Minecraft generado e permite alternar entre o jogo real e o modelo de mundo. A arquitetura utiliza um transformer com atenção causal em bloco tanto para o tokenizador quanto para o modelo de dinâmica. O tokenizador é um Autoencoder Mascarado baseado em transformer, alcançando aproximadamente 100× de compressão sem perda KL ou adversária. O modelo de dinâmica (1,6 bilhões de parâmetros) realiza previsão do próximo quadro usando difusão forçada, flow matching e modelos de atalho, além de prever a próxima ação. O treinamento é executado por 200.000 passos com o otimizador Muon, agendamento WSD, taxa de aprendizado máxima de 3e-4 e decaimento EMA de 0,999. A equipe alcançou 57-58% de utilização de FLOPs do modelo em GPUs B200, com o estado do modelo ocupando aproximadamente 24 GiB. As ativações foram o principal custo de memória, resolvido por paralelismo de dados e checkpointing de ativações. Problemas de estabilidade foram o maior desafio; seis correções incluem otimizador Muon, pesos EMA obrigatórios, precisão mista cuidadosa, ponderação de perda v-space, transporte ótimo barycentric em minilotes e despriorização da parametrização μ. O repositório não inclui o loop de treinamento de clonagem de comportamento ou aprendizado por reforço, e as pontuações FVD não foram publicadas.
Fonte: MarkTechPost — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas