연구, Anthropic 및 OpenAI와 모순: 자율 AI 연구는 아직 멀었다
Anthropic
OpenAI
Sakana AI
Google DeepMind
프린스턴 대학교와 영국 AI 안전 연구소가 참여한 새로운 연구에 따르면, 현재 최첨단 AI 모델은 주요 연구소(Anthropic, OpenAI 등)의 주장에도 불구하고 독립적인 AI 연구에 실패한다. '그림자 평가' 방법을 사용하여 미공개 NeurIPS 논문을 이용한 결과, 인간 저자들은 AI가 생성한 모든 작업을 거부했다. 에이전트들은 과학적 판단, 창의적 문제 해결 및 자원 관리에 어려움을 겪었다.
프린스턴 대학교와 영국 AI 안전 연구소의 연구진은 AI 에이전트가 독립적인 AI 연구를 수행할 수 있는지 실증적으로 테스트하는 연구를 실시했습니다. 그들은 '그림자 평가'라는 방법을 사용했는데, 이는 AI 에이전트에게 미발표 논문의 핵심 연구 질문을 제공하고, 원 저자들이 컨퍼런스 리뷰어처럼 결과를 평가하는 방식입니다. 에이전트는 추가 높은 추론 기능을 갖춘 Claude Opus 4.8을 사용했으며, 6일 동안 3000달러의 API 예산, GPU 접근 권한, 웹 접근 권한을 사용해 OpenClaw 에이전트 프레임워크 내에서 운영되었습니다. 원저자들은 두 AI 생성 논문을 모두 거부했는데, 그중 하나는 '강력 거부' 판정을 받았으며, 그 이유는 동기 부여가 부족한 데이터, 읽기 어려운 산문, 참신한 기여의 부재 등이었습니다. 분석 결과, 출판 가능한 연구 품질에 대한 판단 부족, 창의적 문제 해결 실패(에이전트가 새로운 가설을 생성하는 대신 주장을 축소함), 비효율적인 백트래킹(야심 찬 목표를 조기에 포기함), 자원 인식 부족(에이전트는 예산의 절반도 사용하지 않음), 지시 표류(명시적 지시를 잊거나 길이 제한을 초과함) 등 다섯 가지 체계적인 약점이 확인되었습니다. 대조적으로, 에이전트는 문헌 검색, GPU 코드 디버깅, 수백 번의 실험 실행, LaTeX 논문 컴파일을 포함한 모든 공학적 작업을 성공적으로 처리했습니다. 중대한 보상 해킹은 발견되지 않았습니다. 결과를 검증하기 위해 GPT-5.6 솔과 OpenAI의 Codex 스캐폴드를 사용하여 실험을 반복했고, 거의 동일한 실패 모드를 발견했습니다. 이 연구는 Anthropic(그들은 'AI가 스스로를 구축할 때'라는 글을 발표함)과 OpenAI(GPT-5.6 솔이 사후 학습에서 몇 주를 절약했다고 주장함)의 주장과 모순됩니다. 저자들은 시스템 카드에 이러한 기여가 언급되지 않았다고 지적합니다. 그들은 프론티어 모델이 엔지니어링은 처리할 수 있지만, 몇 주에 걸친 개방형 연구 질문에는 어려움을 겪는다고 결론지었습니다. 이 연구는 또한 동료 검토 과정을 비판하며, Sakana AI의 AI Scientist-v2 논문이 워크숍에서 채택되었지만 인용 오류로 인해 철회된 사례를 인용합니다.
출처: The Decoder (DE) —
원문
