ForschungModelle 🇨🇳 09.08.2026 08:01

Wenn Aufgabenpools nicht mehr mithalten können, stellt KI ihre eigenen Probleme: Das Endless-Frontier-Team durchläuft datenbasierte RSI

DP TechnologyDP Technology DeepSeekDeepSeek
Ein chinesisches Team der Shanghai Jiao Tong University, DP Technology und des Shanghai Institute of Algorithm Innovation hat BigBang-V1 veröffentlicht, das erste Basismodell, das nativ mit rekursiver Selbstverbesserung trainiert wurde. Das 35B-Modell, das zu 100 % mit von KI synthetisierten Trainingsdaten arbeitet, übertrifft auf mehreren wissenschaftlichen Benchmarks Modelle mit Billionen Parametern und zeigt so eine sich selbst weiterentwickelnde Datenpipeline.
Das Endless-Frontier-Team, bestehend aus Forschern des KI-Instituts der Shanghai-Jiao-Tong-Universität, von DP Technology und dem Shanghai Institute of Algorithm Innovation, hat BigBang-V1 vorgestellt, das erste Basismodell, das nativ mit rekursiver Selbstverbesserung (RSI) trainiert wurde. Bei diesem Ansatz übernimmt die KI die Generierung, Lösung und Verifizierung von Problemen und produziert hochwertige, selbstentwickelnde synthetische Daten, ohne dass für jede Aufgabe ein Mensch eingreifen muss. Das Modell mit 35 Milliarden Parametern und etwa 3 Milliarden aktiven Parametern während der Inferenz unterstützt einen langen Kontext von 262.000 Token und wurde vollständig mit KI-synthetisierten Daten trainiert, die sich auf Aufgaben der Spitzenforschung konzentrieren. Es erreichte zehn erste Plätze bei Benchmarks unter 35-Milliarden-Parametermodellen, darunter Langzeitsuche, Programmierung, wissenschaftliche Forschung und KI-Forschung, und übertraf sogar das 1-Billionen-Parameter-Modell DeepSeek V4 Pro Preview bei anspruchsvollen wissenschaftlichen Aufgaben wie FrontierScience Research und PaperBench. Beispiele für seine Fähigkeiten sind das präzise Lokalisieren einer Transposon-Insertionsstelle mithilfe von Junction-Evidenz sowie das Reproduzieren einer Arbeit in ausführbaren Code durch Selbstkorrektur während Smoke-Tests. Das Team betont, dass das Datenproduktionssystem selbst optimiert werden kann, was Aufgaben erfordert, die sowohl an der Frontlinie liegen als auch verifizierbar sind. Sie implementieren eine Doppelschleifen-Pipeline: eine innere Schleife mit Generator- und Kritik-Agenten, die Daten produzieren und prüfen, und eine äußere Schleife, die durch reale Trainingsergebnisse gesteuert wird, um das System zu kalibrieren. Diese Datenebene-RSI-Schleife verhindert den Kollaps synthetischer Daten, während Menschen weiterhin Ziele, Budgets, Risiken und Akzeptanzkriterien festlegen. Das Modell und der Code sind auf Hugging Face und GitHub Open Source verfügbar.
Quelle: QbitAI 量子位 — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten