AI phát hiện lỗi trong 99,2% các bài báo hàng đầu!
OpenAI
Các cuộc kiểm toán gần đây sử dụng các tác tử AI đã tiết lộ rằng nhiều bài báo hội nghị AI hàng đầu không thể tái lập và chứa các lỗi khách quan. Một nghiên cứu cho thấy 99,2% bài báo có ít nhất một lỗi, với trung bình 4,7 lỗi mỗi bài. Xu hướng này gợi ý các cơ hội nghiên cứu mới trong lĩnh vực kiểm toán học thuật.
Các nhà nghiên cứu đã sử dụng các AI agent (tác tử AI) để kiểm tra (audit) các bài báo tại những hội nghị AI hàng đầu, phát hiện ra rằng nhiều kết quả đã công bố không thể tái lập được. Ví dụ, một cuộc kiểm tra bằng AI agent đối với toàn bộ 168 bài thuyết trình miệng (oral presentation) tại ICML 2026 cho thấy trong số 92 bài báo có ít nhất năm luận điểm có thể kiểm chứng, chỉ có 34 bài tái lập được hơn 40% kết luận, và chỉ 8 bài tái lập được hơn 80%. Ngoài ra, bốn bài báo phụ thuộc vào một mô hình đã bị ngừng hoạt động (offline), khiến kết quả của chúng vĩnh viễn không thể tái lập.
Một nghiên cứu khác đã phát triển một công cụ kiểm tra bài báo dựa trên GPT-5, phân tích các bài báo từ những hội nghị AI hàng đầu và phát hiện rằng trung bình mỗi bài báo chứa 4,7 lỗi khách quan, và 99,2% bài báo có ít nhất một vấn đề. Các lỗi về toán học và công thức là phổ biến nhất, chiếm 54,0%. Số lỗi trung bình trên mỗi bài báo tại NeurIPS đã tăng từ 3,8 vào năm 2021 lên 5,9 vào năm 2025. Những phát hiện này cho thấy một vấn đề đang ngày càng nghiêm trọng về khả năng tái lập trong khoa học, đồng thời gợi mở những hướng nghiên cứu mới, chẳng hạn như rà soát lại các bài báo cũ và sửa chữa lỗi sai.
Hơn nữa, một nhà hóa học lý thuyết tại Zhejiang Lab đã phát hiện rằng AI dự đoán điểm sôi khác với dữ liệu trong một cơ sở dữ liệu đã có tuổi đời 75 năm, và sau khi xác minh thủ công, kết quả cho thấy AI đã đúng, từ đó phơi bày những sai sót trong các phép đo lường có tuổi đời hàng thế kỷ. Điều này cho thấy AI giờ đây có thể hỗ trợ việc đánh giá lại các tài liệu khoa học lịch sử.
Nguồn: QbitAI 量子位 —
bản gốc
