Soru Bankaları Yetişemediğinde, Yapay Zeka Kendi Problemlerini Belirlemeye Başlıyor: Endless Frontier Ekibi Veri Düzeyinde RSI Üzerinde Çalışıyor
DP Technology
DeepSeek
Shanghai Jiao Tong Üniversitesi, DP Technology ve Şanghay Algoritma İnovasyon Enstitüsü'nden oluşan Çinli bir ekip, özyinelemeli kendini iyileştirme yöntemiyle doğal olarak eğitilen ilk temel model olan BigBang-V1'i yayınladı. %100 yapay zeka tarafından sentezlenen eğitim verilerine sahip 35 milyar parametreli model, birçok bilimsel kıyaslamada trilyon parametreli modelleri geride bırakarak kendini geliştiren bir veri hattını sergiliyor.
Endless Frontier ekibi, Şanghay Jiao Tong Üniversitesi Yapay Zeka Enstitüsü, DP Technology ve Şanghay Algoritma İnovasyon Enstitüsü'nden araştırmacılardan oluşuyor. Ekip, yinelemeli kendini geliştirme (RSI) yöntemini doğal olarak kullanan ilk temel model olan BigBang-V1'i piyasaya sürdü. Bu yaklaşımda yapay zeka, problem üretme, çözme ve doğrulama işlemlerini üstleniyor ve görev başına insan müdahalesi olmadan yüksek kaliteli, kendi kendine evrilen sentetik veriler üretiyor. 35B parametreli ve çıkarım sırasında yaklaşık 3B aktif olan model, 262K uzun bağlamı destekliyor ve tamamen sınır bilimi görevlerine odaklanmış yapay zeka tarafından sentezlenen verilerle eğitildi. 35B modeller arasında uzun vadeli arama, kodlama, bilimsel araştırma ve yapay zeka araştırması gibi kıyaslamalarda 10 birincilik elde etti ve hatta FrontierScience Research ve PaperBench gibi zor bilimsel görevlerde 1T parametreli DeepSeek V4 Pro Preview'ı geride bıraktı. Yeteneklerine örnek olarak, bir transpozon ekleme bölgesini birleşim kanıtlarını kullanarak hassas bir şekilde bulması ve bir makaleyi duman testleri sırasında kendini düzelterek çalıştırılabilir koda dönüştürmesi verilebilir. Ekip, veri üretim sisteminin optimize edilebileceğini ve hem sınır hem de doğrulanabilir görevler gerektirdiğini vurguluyor. Ayrıca çift döngülü bir boru hattı uyguluyorlar: iç döngü, veri üreten ve denetleyen Üretici ve Eleştirmen ajanlarından oluşuyor; dış döngü ise sistemi kalibre etmek için gerçek eğitim sonuçlarıyla yönlendiriliyor. Bu veri düzeyindeki RSI döngüsü sentetik veri çöküşünü önlüyor, ancak insanlar hâlâ hedefleri, bütçeleri, riskleri ve kabul kriterlerini tanımlıyor. Model ve kod, Hugging Face ve GitHub'da açık kaynak olarak sunuldu.
Kaynak: QbitAI 量子位 —
orijinal
