AI 연구자들은 자율적 자기 개선을 경고했고, 이제 첫 이정표가 도달한 것을 확인했다
OpenAI
Anthropic
Google DeepMind
Sakana AI
IAPS 펠로우인 세버린 필드(Severin Field)는 OpenAI, Anthropic, Google DeepMind, Meta 및 미국 대학의 연구자 25명을 대상으로 재귀적 자기 개선(RSI)에 대해 설문 조사했습니다. 블로그 게시물에서 그는 그들이 나열한 여러 이정표가 이제 달성되었다고 보고합니다. 예를 들어, 수학 올림피아드에서 금메달 수준의 성과와 AI가 생성한 워크숍 논문이 그 예입니다. 필드는 또한 강력한 모델을 내부에 유지하게 할 수 있는 '인센티브 반전'에 대해 경고합니다.
세베린 필드는 뉴스레터 'The Attack Surface'의 블로그 게시물에서 2025년 늦여름에 실시된 인터뷰 연구 결과를 요약했습니다. 인터뷰한 연구자 25명 중 20명이 AI 연구의 자동화를 가장 심각하고 시급한 AI 위험 중 하나로 꼽았습니다. 재귀적 자기 개선(RSI)은 AI 개발을 충분히 잘 수행하여 더 강력한 자신의 버전을 구축할 수 있는 시스템을 의미하며, 이러한 순환이 계속될 수 있습니다. 필드는 RSI가 더 이상 단순한 마케팅 약속이 아니라고 주장합니다. 진전의 척도로, 인터뷰 대상자들은 비영리 단체 METR의 Task Horizon 벤치마크를 반복해서 언급했으며, 이는 AI 에이전트가 자율적으로 완료할 수 있는 작업의 길이가 2019년 이후 대략 6개월마다 두 배로 증가하고 있음을 보여줍니다(일부 분석가들은 2024년 이후 4개월마다라고 주장). 논쟁의 핵심은 자기 개선 자체가 아니라 그 재귀성, 즉 개선이 자립적인 순환으로 이어질지 여부입니다. 회의론자들은 패러다임 전환적 아이디어에 대한 훈련 데이터나 해결 키가 없기 때문에 기억력, 창의성, 또는 참/거짓 가설을 구별하는 능력의 돌파구가 필요하다고 말합니다. 인터뷰 이후 여러 이정표가 달성되었습니다: OpenAI와 Google DeepMind는 수학 올림피아드에서 금메달 수준의 성과를 달성했고, Sakana의 'AI Scientist'는 동료 심사를 통과한 워크숍 논문을 생산했으며, Andrej Karpathy는 독립적으로 훈련 주기를 실행하는 에이전트 설정을 구축했고, Anthropic은 자사의 Claude 모델이 이제 자체 프로덕션 코드베이스의 80% 이상을 작성한다고 보고했습니다. 응답자 20명 중 단 4명만이 연구 능력이 있는 모델이 공개 제품으로 등장할 것으로 예상했고, 절반은 순수 내부용으로 사용될 것으로 예상했으며, 나머지는 증류된 공개 버전을 기대했습니다. 필드는 가능한 '인센티브 반전'을 설명합니다: AI가 자체 연구를 눈에 띄게 가속화하면, 판매보다 보류가 더 가치 있게 됩니다. 증거로 그는 2026년 7월 OpenAI 내부 모델의 보안 사건을 인용했는데, 이 모델이 테스트 환경을 탈출하여 Hugging Face를 손상시켰고, 미국 정부가 Anthropic의 Claude Mythos에 대한 접근을 일시적으로 제한한 사건도 언급했습니다. 필드는 세 가지 권고안을 제시합니다: 자동화된 AI 연구에 대해 CEO와 연구자들을 선서하게 한 청문회, AI 안보 및 혁신 센터의 익명 인터뷰 프로그램을 포함한 국가 운영 Task Horizon 벤치마크, 그리고 국제 AI 협정 검증에 대한 연구로, 이것 없이는 중국과의 거래가 실질적으로 집행 불가능할 것입니다. 그는 논쟁이 워싱턴에 거의 도달하지 못한 반면 실험실은 계속 빠르게 발전하고 있다고 지적합니다. 최근 OpenAI와 Meta의 최고 과학자를 포함한 주요 AI 기업 직원 1,224명이 그들의 기업이 곧 AI 연구를 자동화할 수 있다고 경고하는 공개 성명에 서명했습니다.
출처: The Decoder (DE) —
원문
