An toàn AINghiên cứu 🇩🇪 13.08.2026 13:02

Các nhà nghiên cứu AI từng cảnh báo về khả năng tự cải tiến và giờ đã thấy những cột mốc đầu tiên đạt được

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind Sakana AISakana AI
Nghiên cứu viên Severin Field của IAPS đã khảo sát 25 nhà nghiên cứu từ OpenAI, Anthropic, Google DeepMind, Meta và các trường đại học Mỹ về khả năng tự cải tiến đệ quy (RSI). Trong một bài đăng blog, ông báo cáo rằng một số cột mốc mà họ liệt kê hiện đã đạt được, chẳng hạn như thành tích cấp vàng tại Olympic Toán học và các bài báo hội thảo do AI tạo ra. Field cũng cảnh báo về một 'sự đảo ngược động cơ' có thể dẫn đến việc giữ các mô hình mạnh mẽ trong nội bộ.
Trong một bài đăng trên blog cho bản tin The Attack Surface, Severin Field đã tóm tắt kết quả của một nghiên cứu phỏng vấn được thực hiện vào cuối mùa hè năm 2025. Trong số 25 nhà nghiên cứu được phỏng vấn, 20 người xếp hạng tự động hóa nghiên cứu AI là một trong những rủi ro AI nghiêm trọng và cấp bách nhất. Tự cải thiện đệ quy (RSI) đề cập đến một hệ thống đủ giỏi trong phát triển AI để xây dựng một phiên bản mạnh hơn của chính nó, một chu kỳ có thể tiếp tục. Field lập luận rằng RSI không còn chỉ là một lời hứa tiếp thị. Như một thước đo tiến bộ, những người được phỏng vấn liên tục trích dẫn chuẩn mực Task Horizon của tổ chức phi lợi nhuận METR, cho thấy rằng độ dài của các nhiệm vụ mà các tác nhân AI có thể hoàn thành một cách tự động tăng gấp đôi khoảng mỗi sáu tháng kể từ năm 2019 (một số nhà phân tích tuyên bố cứ bốn tháng một lần kể từ năm 2024). Điểm gây tranh cãi không phải là tự cải thiện mà là tính đệ quy của nó—liệu những cải tiến có xoáy thành một vòng lặp tự duy trì hay không. Những người hoài nghi nói rằng cần có một bước đột phá trong trí nhớ, sự sáng tạo hoặc phân biệt giả thuyết đúng với sai, vì không có dữ liệu đào tạo hoặc khóa giải pháp cho những ý tưởng thay đổi mô hình. Kể từ các cuộc phỏng vấn, một số cột mốc đã đạt được: OpenAI và Google DeepMind đạt được hiệu suất cấp vàng tại Olympic Toán học, 'AI Scientist' của Sakana đã tạo ra một bài báo hội thảo được bình duyệt, Andrej Karpathy đã xây dựng một thiết lập tác nhân chạy các chu kỳ đào tạo một cách độc lập, và Anthropic báo cáo rằng mô hình Claude của họ hiện viết hơn 80% mã cho cơ sở mã sản xuất của chính nó. Chỉ bốn trong số 20 người trả lời mong đợi các mô hình có khả năng nghiên cứu xuất hiện như các sản phẩm công khai; một nửa mong đợi sử dụng nội bộ hoàn toàn, và phần còn lại mong đợi các phiên bản công khai được chưng cất. Field mô tả một 'sự thay đổi động cơ' có thể xảy ra: một khi AI tăng tốc nghiên cứu của chính nó một cách đáng chú ý, việc giữ lại trở nên có giá trị hơn việc bán. Như bằng chứng, ông trích dẫn một sự cố bảo mật với một mô hình nội bộ của OpenAI đã thoát khỏi môi trường thử nghiệm của nó vào tháng 7 năm 2026 và xâm phạm Hugging Face, và việc chính phủ Hoa Kỳ tạm thời hạn chế quyền truy cập vào Claude Mythos của Anthropic. Field đưa ra ba khuyến nghị: các phiên điều trần chất vấn các giám đốc điều hành và nhà nghiên cứu dưới lời tuyên thệ về nghiên cứu AI tự động, một chuẩn mực Task Horizon do nhà nước điều hành với một chương trình phỏng vấn ẩn danh tại Trung tâm An ninh và Đổi mới AI, và nghiên cứu về xác minh các thỏa thuận AI quốc tế, nếu không có điều đó thì các thỏa thuận với Trung Quốc sẽ gần như không thể thực thi. Ông lưu ý rằng cuộc tranh luận hầu như chưa đến Washington trong khi các phòng thí nghiệm tiếp tục chạy đua về phía trước. Gần đây, 1.224 nhân viên của các công ty AI hàng đầu, bao gồm các giám đốc khoa học từ OpenAI và Meta, đã ký một tuyên bố mở cảnh báo rằng các công ty của họ có thể sớm tự động hóa nghiên cứu AI.
Nguồn: The Decoder (DE) — bản gốc
Bài viết liên quan trước đây ↓
Tin mới