Open SourceRecherche 🇺🇸 26.07.2026 15:02

Open Dreamer : Implémentation Open-Source du Pipeline Dreamer 4 en JAX/Flax avec Recette d'Entraînement Complète

Une équipe de chercheurs en IA a publié Open Dreamer, une implémentation open-source du pipeline du modèle de monde Dreamer 4, construite avec JAX et Flax NNX. Le projet comprend un pipeline d'entraînement, un environnement d'inférence local et une démo navigateur générant un monde Minecraft en temps réel. Le modèle utilise un backbone transformer à causalité par blocs, atteint 57 à 58 % d'utilisation des FLOPs du modèle, et l'équipe souligne que la stabilité était le principal défi, non le débit.
Les chercheurs Francesco Sacco, Diego Martí et Edward Hu, sponsorisés par Reactor, ont publié Open Dreamer, une implémentation open source de Dreamer 4 en JAX/Flax NNX. Deux dépôts ont été publiés : l’un pour l’entraînement (tokeniseur, modèle de dynamique, déploiement, scoring FVD) et l’autre pour l’inférence locale. Une démo en ligne diffuse un monde Minecraft généré et permet de basculer entre le jeu réel et le modèle du monde. L’architecture utilise un transformer causal par blocs comme colonne vertébrale pour le tokeniseur et le modèle de dynamique. Le tokeniseur est un autoencodeur masqué basé sur transformer, atteignant une compression d’environ 100× sans perte KL ni perte antagoniste. Le modèle de dynamique (1,6 milliard de paramètres) effectue la prédiction d’image suivante en utilisant le forçage par diffusion, l’appariement de flot et les modèles raccourcis, et prédit également l’action suivante. L’entraînement se déroule sur 200 000 étapes avec l’optimiseur Muon, un programme WSD, un taux d’apprentissage maximal de 3e-4 et un taux de décroissance exponentielle moyenne de 0,999. L’équipe a atteint une utilisation de 57 à 58% des FLOPS du modèle sur des GPU B200, l’état du modèle tenant dans environ 24 Gio. Les activations étaient le principal coût mémoire, résolu par le parallélisme de données et le checkpointing d’activations. Les problèmes de stabilité ont été le plus grand défi ; six correctifs incluent l’optimiseur Muon, les poids EMA obligatoires, la précision mixte soignée, la pondération de perte v-space, le transport optimal barycentrique par minibatch et la désaccentuation de la μ-paramétrisation. Le dépôt n’inclut pas la boucle d’apprentissage par clonage de comportement ou par renforcement, et les scores FVD ne sont pas publiés.
Source: MarkTechPost — original
Nos articles précédents sur ce sujet ↓
Infos fraîches