Quand les banques de questions ne suivent plus, l'IA commence à poser ses propres problèmes : l'équipe Endless Frontier explore le RSI au niveau des données
DP Technology
DeepSeek
Une équipe chinoise de l'Université Jiao Tong de Shanghai, de DP Technology et de l'Institut de l'innovation algorithmique de Shanghai a publié BigBang-V1, le premier modèle de base entraîné nativement par auto-amélioration récursive. Ce modèle de 35 milliards de paramètres, alimenté à 100 % par des données d'entraînement générées par IA, surpasse des modèles à mille milliards de paramètres sur plusieurs benchmarks scientifiques, démontrant un pipeline de données auto-évolutif.
L'équipe Endless Frontier, composée de chercheurs de l'Institut d'IA de l'Université Jiao Tong de Shanghai, de DP Technology et de l'Institut d'innovation algorithmique de Shanghai, a lancé BigBang-V1, le premier modèle de base entraîné nativement à l'aide de l'auto-amélioration récursive (RSI). Dans cette approche, l'IA gère la génération, la résolution et la vérification de problèmes, produisant ainsi des données synthétiques auto-évolutives de haute qualité sans intervention humaine pour chaque tâche. Le modèle, avec 35 milliards de paramètres et environ 3 milliards actifs lors de l'inférence, prend en charge un contexte long de 262 000 jetons et est entièrement entraîné sur des données synthétisées par IA, axées sur des tâches scientifiques de pointe. Il a obtenu 10 premières places parmi les modèles de 35 milliards de paramètres dans des benchmarks incluant la recherche à long horizon, le codage, la recherche scientifique et la recherche en IA, et a même surpassé le modèle DeepSeek V4 Pro Preview (1 billion de paramètres) sur des tâches scientifiques difficiles comme FrontierScience Research et PaperBench. Parmi ses capacités, on peut citer la localisation précise d'un site d'insertion de transposon à l'aide de preuves de jonction, et la réplication d'un article en code exécutable en s'auto-corrigeant lors de tests de fumée. L'équipe souligne que le système de production de données lui-même peut être optimisé, nécessitant des tâches à la fois de pointe et vérifiables, et ils mettent en œuvre un pipeline à double boucle : une boucle interne avec des agents Générateur et Critique qui produisent et vérifient les données, et une boucle externe pilotée par les résultats réels de l'entraînement pour calibrer le système. Cette boucle RSI au niveau des données prévient l'effondrement des données synthétiques, tandis que les humains définissent toujours les objectifs, les budgets, les risques et les critères d'acceptation. Le modèle et le code sont en open source sur Hugging Face et GitHub.
Source: QbitAI 量子位 —
original
