Saat Bank Soal Tak Lagi Mampu Mengikuti, AI Mulai Menyusun Soalnya Sendiri: Tim Endless Frontier Menelusuri RSI di Level Data
DP Technology
DeepSeek
Sebuah tim asal Tiongkok dari Universitas Shanghai Jiao Tong, DP Technology, dan Institut Inovasi Algoritma Shanghai telah merilis BigBang-V1, model dasar pertama yang dilatih secara native menggunakan perbaikan diri rekursif. Model 35B ini, dengan 100% data pelatihan yang disintesis oleh AI, mengungguli model dengan triliunan parameter pada beberapa tolok ukur ilmiah, menunjukkan pipa data yang berevolusi sendiri.
Tim Endless Frontier, yang terdiri dari para peneliti dari Institut AI Universitas Jiao Tong Shanghai, DP Technology, dan Institut Inovasi Algoritma Shanghai, telah meluncurkan BigBang-V1, model dasar pertama yang dilatih secara native menggunakan peningkatan diri rekursif (RSI). Dalam pendekatan ini, AI menangani pembuatan, pemecahan, dan verifikasi masalah, menghasilkan data sintetis berkualitas tinggi yang berevolusi sendiri tanpa keterlibatan manusia per tugas. Model dengan 35 miliar parameter dan sekitar 3 miliar parameter aktif selama inferensi ini mendukung konteks panjang 262 ribu token dan sepenuhnya dilatih pada data sintetis AI yang berfokus pada tugas-tugas sains mutakhir. Model ini meraih 10 posisi pertama di antara model 35 miliar parameter dalam tolok ukur termasuk pencarian jangka panjang, pengodean, riset ilmiah, dan riset AI, bahkan melampaui DeepSeek V4 Pro Preview dengan 1 triliun parameter pada tugas-tugas ilmiah sulit seperti FrontierScience Research dan PaperBench. Contoh kemampuannya termasuk menemukan lokasi penyisipan transposon secara presisi dengan menggunakan bukti sambungan, serta mereplikasi makalah menjadi kode yang dapat dijalankan dengan mengoreksi diri sendiri selama uji asap. Tim menekankan bahwa sistem produksi data itu sendiri dapat dioptimalkan, membutuhkan tugas-tugas yang mutakhir dan dapat diverifikasi, dan mereka menerapkan alur ganda: alur dalam dengan agen Generator dan Kritik yang memproduksi dan memeriksa data, serta alur luar yang digerakkan oleh hasil pelatihan nyata untuk mengkalibrasi sistem. Putaran RSI tingkat data ini mencegah keruntuhan data sintetis, sementara manusia tetap menentukan tujuan, anggaran, risiko, dan kriteria penerimaan. Model dan kode sumber terbuka tersedia di Hugging Face dan GitHub.
Sumber: QbitAI 量子位 —
asli
