問題集が追いつかないとき、AIは自ら問題を設定し始める:エンドレスフロンティアチームがデータレベルのRSIを駆使
DP Technology
DeepSeek
上海交通大学、DPテクノロジー、上海アルゴリズム創新研究院の中国チームが、再帰的自己改善をネイティブに用いて訓練された最初のベースモデルであるBigBang-V1を発表しました。35Bモデルは、100%AI合成の訓練データで、いくつかの科学ベンチマークにおいて兆パラメータモデルを上回る性能を示し、自己進化するデータパイプラインを実証しています。
エンドレス・フロンティア・チーム(上海交通大学AI研究所、DPテクノロジー、上海アルゴリズム革新研究所の研究者から構成)は、再帰的自己改善(RSI)を用いてネイティブに訓練された初のベースモデル、BigBang-V1を発表しました。このアプローチでは、AIが問題生成、解決、検証を担当し、タスクごとに人間の関与なしで高品質な自己進化型の合成データを生成します。このモデルはパラメータ数が350億で、推論中には約30億がアクティブになり、26万2千トークンのロングコンテキストをサポートし、フロンティア科学タスクに焦点を当てたAI合成データのみで訓練されています。ベンチマークでは、長時間の検索、コーディング、科学研究、AI研究などにおいて、350億パラメータモデルの中で10の分野で首位を獲得し、さらに難しい科学タスク(フロンティア科学研究やPaperBenchなど)では、1兆パラメータのDeepSeek V4 Pro Previewをも上回りました。その能力の例としては、ジャンクションエビデンスを用いてトランスポゾン挿入部位を正確に特定したり、スモークテスト中の自己修正を通じて論文を実行可能なコードに複製したりすることが挙げられます。チームは、データ生成システム自体が最適化可能であり、フロンティアかつ検証可能なタスクが必要であることを強調し、デュアルループパイプラインを実装しています。内側のループでは、ジェネレーターとクリティックのエージェントがデータを生成・検証し、外側のループでは実際のトレーニング結果に基づいてシステムを較正します。このデータレベルのRSIループは合成データの崩壊を防ぎますが、人間は依然として目標、予算、リスク、受け入れ基準を定義します。モデルとコードはHugging FaceとGitHubでオープンソース化されています。
出典: QbitAI 量子位 —
原文
