OnderzoekModellen 🇨🇳 09.08.2026 08:01

Wanneer Vragenbanken Niet Kunnen Bijblijven, Gaat AI Zelf Problemen Stellen: Het Endless Frontier-team Doorloopt de Data-niveau RSI

DP TechnologyDP Technology DeepSeekDeepSeek
Een Chinees team van de Shanghai Jiao Tong Universiteit, DP Technology en het Shanghai Instituut voor Algoritme-innovatie heeft BigBang-V1 uitgebracht, het eerste basismodel dat natively is getraind met behulp van recursieve zelfverbetering. Het 35B-model, met 100% AI-gesynthetiseerde trainingsdata, presteert beter dan modellen met biljoenen parameters op verschillende wetenschappelijke benchmarks, wat een zelf-evoluerende datapijplijn laat zien.
Het Endless Frontier-team, bestaande uit onderzoekers van het AI-instituut van de Shanghai Jiao Tong-universiteit, DP Technology en het Shanghai Instituut voor Algoritme-innovatie, heeft BigBang-V1 gelanceerd, het eerste basismodel dat van nature is getraind met behulp van recursieve zelfverbetering (RSI). Bij deze aanpak zorgt AI voor het genereren, oplossen en verifiëren van problemen, waardoor hoogwaardige, zelf-evoluerende synthetische gegevens worden geproduceerd zonder menselijke betrokkenheid per taak. Het model, met 35B parameters en ongeveer 3B actief tijdens de inferentie, ondersteunt een lange context van 262K en is volledig getraind op door AI gesynthetiseerde gegevens die zich richten op wetenschappelijke taken aan de grens van kennis. Het behaalde tien eerste plaatsen bij 35B-modellen in benchmarks, waaronder langetermijnzoekopdrachten, programmeren, wetenschappelijk onderzoek en AI-onderzoek, en overtrof zelfs het DeepSeek V4 Pro Preview-model met 1T-parameters bij moeilijke wetenschappelijke taken zoals FrontierScience Research en PaperBench. Voorbeelden van zijn kunnen zijn onder meer het nauwkeurig lokaliseren van een transposon-insertieplaats met behulp van junction-bewijs, en het repliceren van een paper naar uitvoerbare code door zelfcorrectie tijdens smoke tests. Het team benadrukt dat het gegevensproductiesysteem zelf kan worden geoptimaliseerd, waarvoor taken nodig zijn die zowel aan de grens liggen als verifieerbaar zijn, en ze implementeren een dual-loop-pijplijn: een interne lus met Generator- en Critic-agenten die gegevens produceren en controleren, en een externe lus die wordt aangestuurd door echte trainingsresultaten om het systeem te kalibreren. Deze RSI-lus op gegevensniveau voorkomt synthetische gegevensinstorting, terwijl mensen nog steeds doelen, budgetten, risico's en acceptatiecriteria definiëren. Het model en de code zijn open-source beschikbaar op Hugging Face en GitHub.
Bron: QbitAI 量子位 — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws