연구 🇺🇸 13.08.2026 20:03

ICML 논문 2,200편 재현 실험에서 배운 것

Hugging FaceHugging Face AnthropicAnthropic OpenAIOpenAI CursorCursor alphaXivalphaXiv
Hugging Face는 alphaXiv와 함께 ICML 2026 오픈 재현 챌린지를 진행했는데, 참가자들은 AI 코딩 에이전트를 사용하여 2,200편의 논문 재현을 시도했습니다. 그 결과, 검토된 논문의 51%에서 최소 하나의 주장이 검증되었고, 23%는 주장이 반증되거나 논쟁이 있었으며, 242편은 상충된 판정을 받았습니다. 에이전트가 한계에 부딪히고 잘못된 반증이 발생했기 때문에 인간의 감독이 중요한 것으로 드러났으며, 이 행사는 현재까지 ML 학회에서 가장 큰 규모의 주장 수준 감사로 간주됩니다.
Hugging Face와 alphaXiv는 2026년 7월 15일부터 8월 2일까지 ICML 2026 오픈 재현 챌린지를 조직하여, 참가자들이 Claude Code, Codex, Cursor, Pi와 같은 AI 코딩 에이전트를 사용하여 학회 논문을 재현하도록 초대했습니다. 참가자들은 20달러 상당의 컴퓨팅 크레딧을 받았고 2,962개의 클라우드 작업을 시작했습니다. 완전한 재현이 불가능한 경우에는 합성 데이터에 대한 장난감 재현이 사용되었습니다. 검토된 2,200편의 논문 중 1,103편(51%)은 적어도 하나의 주장이 독립적으로 검증되었으며, 이 중 266편은 완전히 재현되었고 632편은 부분적으로 재현되었으며 반증된 것은 없었습니다. 3,978개의 개별 주장이 확인되었습니다. 그러나 496편(23%)은 적어도 하나의 주장이 반증되거나 이의가 제기되었으며, 이 중 49편은 모든 주장이 반증되었고 242편은 독립적인 팀들이 동일한 주장에 대해 상반된 결론에 도달했습니다. 주목할 만한 확인된 반증 사례로는 페이지 매김 논문의 증명이 k=1024에서 실패한 경우, 정리가 224단계에서 붕괴된 경우, 이론 논문이 역방향 KL을 사용한 반면 코드는 정방향 KL을 사용한 경우, 그리고 평가가 EOS 패딩 토큰으로 인해 희석된 경우가 있습니다. 조직자들은 주장된 모든 반증을 재검증하고 저자들에게 연락했으며, 저자들은 긍정적으로 응답했습니다. 이 챌린지는 또한 에이전트가 지역 루프나 잘못된 해석과 같은 한계에 부딪히고, 인간의 감독이 신뢰할 수 있는 결과를 위해 필수적이라는 점을 강조했습니다. 예를 들어 인간-인-더-루프 우승자는 이미지 쌍을 직접 판단했습니다. 이 이벤트는 기계 학습 학회에 대한 가장 큰 공개적이고 주장별 감사로 간주되며, 모든 로그북, 판정, 추적 및 산출물이 공개되어 있습니다.
출처: Hugging Face blog — 원문
관련 게시물 ↓
새로운 뉴스