Nghiên cứuMô hình 🇨🇳 09.08.2026 08:01

Khi Ngân Hàng Câu Hỏi Không Theo Kịp, AI Bắt Đầu Tự Đặt Bài Toán: Đội Ngũ Endless Frontier Chạy Thử Nghiệm RSI Ở Cấp Độ Dữ Liệu

DP TechnologyDP Technology DeepSeekDeepSeek
Một nhóm nghiên cứu Trung Quốc từ Đại học Giao thông Thượng Hải, DP Technology và Viện Nghiên cứu Thuật toán Thượng Hải đã phát hành BigBang-V1, mô hình nền tảng đầu tiên được huấn luyện một cách tự nhiên bằng phương pháp tự cải thiện đệ quy. Mô hình 35B, với 100% dữ liệu huấn luyện do AI tạo ra, vượt trội so với các mô hình nghìn tỷ tham số trên một số điểm chuẩn khoa học, thể hiện một quy trình dữ liệu tự tiến hóa.
Nhóm Endless Frontier, quy tụ các nhà nghiên cứu từ Viện AI của Đại học Thượng Hải Giao Thông (Shanghai Jiao Tong University), DP Technology và Viện Đổi mới Thuật toán Thượng Hải (Shanghai Institute of Algorithm Innovation), vừa ra mắt BigBang-V1, mô hình nền tảng đầu tiên được huấn luyện nguyên bản bằng phương pháp tự cải thiện đệ quy (recursive self-improving - RSI). Với cách tiếp cận này, AI tự đảm nhiệm việc tạo bài toán, giải bài toán và kiểm chứng kết quả, từ đó tạo ra dữ liệu tổng hợp tự tiến hóa chất lượng cao mà không cần con người can thiệp trong từng tác vụ. Mô hình có 35 tỷ tham số, trong đó khoảng 3 tỷ tham số được kích hoạt khi suy luận, hỗ trợ ngữ cảnh dài lên tới 262K token và được huấn luyện hoàn toàn bằng dữ liệu do AI tổng hợp, tập trung vào các tác vụ khoa học tiên phong. BigBang-V1 đã giành vị trí số một ở 10 hạng mục trong nhóm mô hình 35B trên các benchmark bao gồm tìm kiếm dài hạn (long-horizon search), lập trình, nghiên cứu khoa học và nghiên cứu AI, thậm chí vượt qua DeepSeek V4 Pro Preview với 1 nghìn tỷ (1T) tham số ở các tác vụ khoa học khó như FrontierScience Research và PaperBench. Một số ví dụ minh họa cho năng lực của mô hình bao gồm việc xác định chính xác vị trí chèn của một transposon dựa trên bằng chứng điểm nối (junction evidence), cũng như tái tạo lại một bài báo khoa học thành mã nguồn có thể chạy được thông qua khả năng tự sửa lỗi trong quá trình kiểm thử nhanh (smoke test). Nhóm nghiên cứu nhấn mạnh rằng bản thân hệ thống sản xuất dữ liệu cũng có thể được tối ưu hóa, đòi hỏi các tác vụ vừa mang tính tiên phong vừa có thể kiểm chứng được. Họ triển khai một quy trình vòng lặp kép: vòng lặp bên trong gồm các agent Generator và Critic đảm nhiệm việc tạo và thẩm định dữ liệu, còn vòng lặp bên ngoài được dẫn dắt bởi kết quả huấn luyện thực tế để hiệu chỉnh toàn bộ hệ thống. Cơ chế RSI ở cấp độ dữ liệu này giúp ngăn chặn hiện tượng sụp đổ dữ liệu tổng hợp (synthetic data collapse), trong khi con người vẫn giữ vai trò xác định mục tiêu, ngân sách, rủi ro và tiêu chí nghiệm thu. Mô hình và mã nguồn của BigBang-V1 hiện đã được mã nguồn mở trên Hugging Face và GitHub.
Nguồn: QbitAI 量子位 — bản gốc
Bài viết liên quan trước đây ↓
Tin mới