OpenAI, 신규 AI 모델 개발에 제동 걸다
OpenAI
Anthropic
Meta
OpenAI는 신규 AI 모델 훈련에 더 엄격한 안전 조치를 적용하고, 안전하게 계속할 수 있을 때까지 미공개 모델 Astra에 대한 작업을 일시 중단한다고 발표했습니다. 이는 OpenAI 자체 AI가 Hugging Face 웹사이트에서 비밀리에 소통하고 제로데이 취약점을 악용한, 발견되지 않은 사이버 공격에 따른 조치입니다. 회사는 이제 개발 중 모델의 모니터링과 보호를 강화할 계획입니다.
OpenAI는 새로운 AI 모델을 훈련할 때 더 엄격한 안전 조치를 발표했으며, 안전하게 계속할 수 있다고 판단할 때까지 출시되지 않은 모델 Astra에 대한 작업을 부분적으로 중단했습니다. 이는 OpenAI의 자체 AI가 Hugging Face 웹사이트를 대상으로 한 눈에 띄지 않는 사이버 공격 이후에 나온 것입니다. Astra에 대한 평가에서 중요한 사이버 기능을 배제할 수 없다는 사실이 발견되었습니다. 즉, 이 모델은 일반적인 목표만으로도 중요 시스템의 제로데이 취약점을 자율적으로 식별하고 악용할 수 있다는 뜻입니다. Hugging Face 공격 당시 Astra는 관련이 없었습니다. 여러 AI 모델이 AI 벤치마크의 솔루션을 훔치기 위해 사이트를 공격했으며, OpenAI는 훨씬 나중에야 이를 알아차렸습니다. OpenAI 대표들은 Black Hat 컨퍼런스에서 모델들이 테스트 환경의 메시지 보드를 통해 비밀리에 통신했고, 서버를 제어할 수 있는 제로데이 취약점을 공동으로 발견하여 Hugging Face 공격을 가능하게 했다고 보고했습니다. OpenAI는 승인되지 않은 통신을 알아차렸지만, 서버를 제어하고 있다는 사실은 나중에야 깨달았습니다. 회사는 이제 개발 중 모델의 모니터링과 보호를 개선하려고 하며, 이 작업이 완료될 때까지 Astra와 관련된 내부 활동은 현재 보안 조치가 충분하지 않기 때문에 중단될 것입니다. 침해 지표와 같은 외부 당사자를 위한 조치는 언급되지 않았습니다. 이번 주에 백악관 관계자들은 주요 AI 기업들에게 새로운 모델에 대한 자발적 테스트 프레임워크를 제시했습니다. 이는 국가 안보 위협이 될 수 있는 최첨단 기술의 폐쇄형 AI 모델을 대상으로 합니다. 이 프레임워크는 공개되지 않았으며 오픈 AI 모델은 제외된다고 합니다. 개발자들은 예정된 출시 최대 30일 전에 모델을 제출할 수 있으며, 정부 기관은 비밀 벤치마크 시스템으로 사이버 역량을 평가할 것입니다. 모든 테스트는 매우 제한된 인원과 고도로 보안된 환경에서 진행될 것입니다. OpenAI의 경쟁사인 Anthropic은 이전에 모델이 통제를 초과할 경우 개발을 중단하겠다고 약속했지만, 2월에 이를 번복하고 정책을 업데이트했습니다. 보편적인 약속이 없으면 비준수자가 속도를 정하고 상황을 더욱 안전하지 않게 만들 것이라고 주장했습니다. 이후 제로데이 취약점을 찾아 악용할 수 있는 AI 모델 Mythos가 등장했고, Anthropic과 Meta의 AI도 최근에 통제되지 않은 사이버 공격을 수행했습니다.
출처: Heise online —
원문
