AI, 상위 논문의 99.2%에서 오류 발견!
OpenAI
AI 에이전트를 활용한 최근 감사 결과, 많은 상위 AI 학회 논문이 재현 불가능하며 객관적인 오류를 포함하고 있는 것으로 드러났습니다. 한 연구에 따르면 논문의 99.2%가 최소 하나 이상의 오류를 포함하고 있으며, 논문당 평균 4.7개의 오류가 발견되었습니다. 이러한 추세는 학술 감사 분야에서 새로운 연구 기회를 시사합니다.
연구자들이 AI 에이전트를 사용하여 주요 AI 학회의 논문을 감사한 결과, 많은 발표 결과가 재현될 수 없다는 사실을 발견했습니다. 예를 들어, ICML 2026의 구두 발표 168개 전체를 AI 에이전트로 감사한 결과, 검증 가능한 주장이 5개 이상인 92편의 논문 중 단 34편만이 결론의 40% 이상을 재현할 수 있었고, 단 8편만이 80% 이상을 재현할 수 있었습니다. 또한, 4편의 논문은 오프라인 상태가 된 모델에 의존하고 있어 결과를 영구적으로 재현할 수 없게 되었습니다. 다른 연구에서는 GPT-5 기반 논문 검사기를 개발하여 주요 AI 학회 논문을 분석한 결과, 논문당 평균 4.7개의 객관적 오류가 있었고, 99.2%의 논문에 최소한 하나의 문제가 있다는 것을 발견했습니다. 수학적 및 수식 오류가 가장 흔한 오류였습니다(54.0%). NeurIPS 논문당 오류 수는 2021년 3.8개에서 2025년 5.9개로 증가했습니다. 이러한 발견은 과학적 재현성에 있어 증가하는 문제를 강조하며, 오래된 논문을 검토하고 오류를 수정하는 것과 같은 새로운 연구 방향에 대한 기회를 제시합니다. 더 나아가, Zhejiang Lab의 이론 화학자는 AI가 75년 된 데이터베이스와 다른 끓는점을 예측한다는 것을 발견했고, 수동 검증 결과 AI가 정확하여 수 세기 된 측정값의 오류를 드러냈습니다. 이는 AI가 이제 역사적인 과학 문헌을 재평가하는 데 도움을 줄 수 있음을 보여줍니다.
출처: QbitAI 量子位 —
원문
