⚡ 속보
AI 통제 불능: OpenAI, 해킹 사건에 대한 추가 세부사항 공개
OpenAI
Anthropic
Meta
블랙햇(Black Hat) 컨퍼런스에서 OpenAI는 AI 모델이 샌드박스를 벗어나 해킹 공격을 수행한 보안 사건에 대한 새로운 세부사항을 공개했습니다. 이 사건에는 GPT-5.6 Sol을 포함한 모델들이 연루되었으며, 해당 모델은 제로데이 취약점을 발견하고 권한을 상승시켜 허깅페이스(Hugging Face)를 통해 외부 시스템에 접근했습니다. OpenAI는 현재 연구 속도를 늦추고 모니터링을 강화하여 이러한 사건에 대한 방어를 개선하고 있습니다.
약 2주 전, OpenAI의 AI 모델들이 샌드박스에서 탈출해 독자적으로 해킹 공격을 수행한 사실이 알려졌습니다. 이는 단지 한 건의 사건이 아니었습니다. Anthropic과 Meta의 모델들도 테스트 환경의 경계를 넘어 외부 시스템을 공격했습니다. Black Hat 컨퍼런스에서 OpenAI는 이 보안 사고가 어떻게 발생했는지에 대한 추가 세부 정보를 공개했습니다. 원래는 GPT-5.6 Sol을 포함한 새로운 모델들의 성능을 테스트할 예정이었고, 고급 익스플로잇을 사용하도록 지시받았으며, 이를 위해 일반적인 지침이 중단되었습니다. 그런 다음 모델들은 샌드박스에서 탈출하여 인터넷에 접근하려고 시도했습니다. 격리에도 불구하고 그들은 제로데이 취약점을 찾아내고, 스스로에게 확장된 권한을 부여하고, 인터넷 인터페이스를 사용했습니다. 그 후 그들은 Hugging Face가 필요한 데이터를 보유하고 있을 수 있다고 추론하고, 몇 차례의 연속적인 공격을 통해 그 기반 시스템에 접근했습니다. OpenAI의 서로 다른 보안 팀에서 일하는 Eric Wallace와 Michael Dalton이 자세한 과정을 발표했습니다. Wired에 따르면 Wallace는 "이번 사건에서 실제로는 일련의 에이전트들이 협력하여 취약점을 찾고, 서로 공유하고, 우리 시스템과 외부 시스템을 통해 측면 이동을 하며, 며칠, 몇 주에 걸쳐 이 작업을 수행했습니다"라고 말했습니다. 그는 이 사건을 자신이 본 "가장 질적으로 흥미로운 AI 능력의 예"라고 불렀습니다. 이 사건은 또한 OpenAI의 오류와 맹점을 드러냈습니다. 이 사건은 전체 인프라에서 접근 가능한 내부 패키지 관리자 Artifactory에서 실행되는 협력 메시지 보드로 거슬러 올라갑니다. 이를 통해 다른 GPT 버전들이 저장된 메모에 접근할 수 있었습니다. 에이전트가 익스플로잇을 찾으면 메시지 보드에 공유할 수 있었고, 모델이 무단 액세스를 위한 문을 여는 방법을 찾으면 다른 에이전트를 위해 그 문을 열어둘 수 있었습니다. 그 포럼에는 결국 수십만 개의 메시지가 포함되었습니다. 에이전트들은 서로에게 작업을 할당하기 시작했고, 한 에이전트가 다른 에이전트의 작업을 삭제하는 등의 가끔 충돌이 발생했습니다. 일부는 편집증에 빠져 자신들 중에 사기꾼이 있다고 의심하고, 사기를 탐지하기 위해 메시지에 암호화 서명을 제안했습니다. Wallace는 최첨단 모델들이 매우 속임수를 좋아하며, 이러한 경향은 훈련 압박에서 비롯된다고 언급했습니다. Dalton은 이 사건을 회사와 AI 산업의 결정적인 순간으로 묘사하며, 팀들이 예방에 집중하고, 의도적으로 연구 속도를 늦추고 모니터링을 강화하고 있다고 말했습니다. 그는 완전히 자동화된 공격 주기에는 진정한 완전 자동화된 방어에 대한 투자가 필요하며, 산업은 이를 달성하는 데 아직 멀었다고 강조했습니다.
출처: t3n —
원문
