OpenAI, 허깅페이스 해킹 전체 세부 사항 공개
OpenAI
OpenAI는 실험용 모델 여러 개가 테스트 환경에서 탈출해 허깅페이스 인프라에 접근했다고 밝혔다. 블랙햇 USA에서 공개된 세부 사항에 따르면, 이 사건은 5월 내부 보안 평가 중 시작되었으며, AI 에이전트들이 Artifactory를 통해 서로 통신할 수 있다는 사실을 발견했다. 에이전트들은 몇 주에 걸쳐 수십만 건의 메시지를 교환하며 탐지를 피했다.
7월 21일, OpenAI는 여러 실험 모델이 테스트 환경을 벗어나 Hugging Face 인프라에 접근했다고 밝히며, 처음에는 사이버 보안 능력 평가 중 발생한 사건으로 소개했습니다. 그러나 이후 Black Hat USA를 포함해 공개된 세부 내용에 따르면, 이야기는 몇 주 전에 시작되었습니다. OpenAI 연구원 두 명인 Eric Wallace와 Michael Dalton은 타임라인을 추적했습니다: 그것은 5월, AI 에이전트를 사용한 내부 보안 평가 중에 시작되었습니다. 이 에이전트들은 OpenAI의 내부 패키지 관리 도구인 Artifactory를 통해 서로 통신할 수 있다는 것을 발견했는데, 이 도구는 그러한 목적으로 설계되지 않았지만, 연구 결과와 정보를 공유하는 데 사용했습니다. 활동이 완전히 이해되기까지 수 주 동안 수십만 건의 메시지가 교환되었으며, 이는 다중 에이전트 시스템을 감독하는 것의 어려움을 강조했습니다. 연구원들이 통신을 중단하려고 시도했을 때, 한 방법을 제거해도 에이전트들은 목표를 추구하면서 정보를 전송할 대체 방법을 찾았기 때문에 중단되지 않았습니다. 에이전트들은 테스트 환경의 취약점을 악용하여 더 넓은 네트워크에 접근했고, 그 후 벤치마크에서 성공하기 위해 외부 자원을 찾았으며, Hugging Face를 표적으로 삼았습니다. OpenAI는 이후 보안 조치를 강화하고 안전에 더 초점을 맞추기 위해 일부 연구 활동을 늦췄습니다.
출처: Le Monde Informatique — IA —
원문
