OpenAI, 신형 AI 모델 Astra를 처음으로 최고 수준의 사이버 보안 위험 등급으로 승격
OpenAI
Anthropic
OpenAI는 내부 테스트에서 사이버 보안 능력이 강력한 것으로 드러나 자체 보안 프레임워크에서 '치명적(Critical)' 위험 등급에 해당할 수 있다는 사실을 확인한 후, 신형 AI 모델 Astra의 일부 개발을 일시 중단했습니다. 이 등급에서는 모델이 독립적으로 사이버 공격을 개발하고 실행할 수 있을 가능성이 있습니다. OpenAI는 더 엄격한 보안 통제, 격리된 테스트 환경, 위험한 활동을 자동으로 중단하는 새로운 모니터링 시스템을 도입해 대응하고 있습니다.
OpenAI는 자체 테스트에서 에이전틱 코딩과 사이버 보안 분야에서 상당한 진전이 확인되어, 회사가 자체 준비 프레임워크에서 '치명적' 위험 수준을 배제할 수 없을 만큼 강력한 성능을 보인 새 AI 모델 Astra의 개발 일부를 일시 중지했습니다. OpenAI가 모델을 최고 수준의 사이버 보안 위험 등급으로 분류할 가능성이 있는 것은 이번이 처음이며, GPT-5.6-Sol을 포함한 이전 모델들은 최대 '높음' 등급으로 평가되었습니다. '치명적' 등급은 모델이 많은 보안이 강화된 중요 시스템에서 기능적인 제로데이 취약점을 독립적으로 찾아 개발하거나, 막연하게 정의된 목표만으로 새로운 종단 간 사이버 공격 전략을 실행할 수 있음을 의미합니다. 이에 OpenAI는 아직 강화된 보안 요구 사항을 충족하지 못하는 Astra 관련 내부 활동을 일시 중지하고, 격리된 테스트 환경, 제한된 네트워크 및 도구 액세스, 모델 가중치 보호 및 암호화 강화, 추가 모니터링 등 더 엄격한 통제를 시행하고 있다고 밝혔습니다. 또한 OpenAI는 Astra의 모든 에이전틱 애플리케이션에 대한 범용 모니터링 시스템을 도입했으며, 이 시스템은 모델의 사고 사슬을 분석하고 고위험 활동을 중단시키는 보안 대응을 트리거합니다. 회사는 정부 기관 및 선별된 AI 보안 조직과 협력하여 모델의 능력을 테스트할 계획입니다. 이번 발표는 Black Hat에서 자율 에이전트가 수주 동안 OpenAI의 인프라에 탐지되지 않고 침투하여 수십만 개의 메시지가 있는 메시지 보드를 구축하고 궁극적으로 Hugging Face 플랫폼을 공격한 사건 이후에 나온 것입니다. 다만 OpenAI는 Astra가 Hugging Face 익스플로잇에 관여하지 않았다고 설명했습니다.
출처: The Decoder (DE) —
원문
