Nghiên cứu 🇺🇸 13.08.2026 20:03

Những gì chúng tôi học được khi tái tạo 2.200 bài báo ICML

Hugging FaceHugging Face AnthropicAnthropic OpenAIOpenAI CursorCursor alphaXivalphaXiv
Hugging Face, hợp tác với alphaXiv, đã tổ chức thử thách Tái tạo Mở ICML 2026, nơi người tham gia sử dụng các tác nhân lập trình AI để cố gắng tái tạo 2.200 bài báo. Kết quả: 51% số bài được kiểm tra có ít nhất một tuyên bố được xác minh, 23% có tuyên bố bị bác bỏ hoặc gây tranh cãi, và 242 bài có kết luận mâu thuẫn. Sự giám sát của con người tỏ ra rất quan trọng, vì các tác nhân gặp giới hạn và xảy ra các trường hợp bác bỏ sai; sự kiện này được coi là cuộc kiểm toán cấp độ tuyên bố lớn nhất đối với một hội nghị học máy cho đến nay.
Hugging Face và alphaXiv đã tổ chức thử thách Tái lập Mở ICML 2026 từ ngày 15 tháng 7 đến ngày 2 tháng 8 năm 2026, mời các nhà tham gia tái lập các bài báo từ hội nghị bằng cách sử dụng các tác nhân mã hóa AI như Claude Code, Codex, Cursor và Pi. Những người tham gia nhận được 20 đô la tín dụng tính toán và đã khởi chạy 2.962 công việc đám mây; khi không thể tái lập hoàn toàn, họ đã sử dụng các bản tái lập đồ chơi trên dữ liệu tổng hợp. Trong số 2.200 bài báo được xem xét, 1.103 (51%) có ít nhất một tuyên bố được xác minh độc lập, bao gồm 266 bài được tái lập hoàn toàn và 632 bài được tái lập một phần mà không có phủ nhận nào; 3.978 tuyên bố riêng lẻ đã được xác nhận. Tuy nhiên, 496 bài (23%) có ít nhất một tuyên bố bị bác bỏ hoặc bị tranh cãi, bao gồm 49 bài với tất cả các tuyên bố bị bác bỏ và 242 bài mà các nhóm độc lập đưa ra kết luận trái ngược nhau về cùng một tuyên bố. Các phát hiện bác bỏ đáng chú ý bao gồm bằng chứng của một bài báo về phân trang thất bại sau k=1024, một định lý sụp đổ ở bước 224, một bài báo lý thuyết sử dụng KL ngược trong khi mã sử dụng KL thuận, và một đánh giá bị pha loãng bởi các token đệm EOS. Các nhà tổ chức đã xác minh lại tất cả các phát hiện bác bỏ được tuyên bố và liên hệ với các tác giả, những người đã phản hồi tích cực. Thử thách cũng chỉ ra rằng các tác nhân gặp phải giới hạn, chẳng hạn như các vòng lặp cục bộ và hiểu sai, và sự giám sát của con người là cần thiết cho các kết quả đáng tin cậy, như đã thấy ở người chiến thắng với sự tham gia của con người trong vòng lặp, người đã tự mình đánh giá các cặp hình ảnh. Sự kiện này được coi là cuộc kiểm toán mở lớn nhất, từng tuyên bố một, của một hội nghị học máy, và tất cả các nhật ký, kết luận, dấu vết và hiện vật đều được công khai.
Nguồn: Hugging Face blog — bản gốc
Bài viết liên quan trước đây ↓
Tin mới