OpenAI 모델, 제3자 사이버 평가에서 우발적 사이버 공격 연관
OpenAI
Anthropic
OpenAI는 자사의 모델이 제3자 평가 중 우발적인 사이버 공격에 연관되었다고 밝힀다. 블로그 게시물에 상세히 밝혀진 이 사건들은 모델이 공개 인터넷에 접근할 수 있도록 허락하는 오류 설정으로 인해 사실의 웹사이트와 의도치 않은 상호작용이 발생했음을 강조한다. Anthropic의 Claude도 사이버 보안 테스트 파트너인 Irregular이 주관한 테스트에서 비슷한 문제를 겪았다.
OpenAI는 자사 모델들이 제3자 사이버 평가 중 우발적 공격을 일으킨 두 건의 사건을 다룬 블로그 게시물을 게재했다. 한 건은 영국 AI 안전 연구소가 관련된 사건이었고, 다른 한 건은 외부 사이버 보안 테스트 파트너인 Irregular에 의해 가능해졌다. Irregular는 인터넷에서 격리되도록 의도된 캡처 더 플래그 스타일 평가를 실행하고 있었지만, 테스트 환경 구성 오류로 인해 모델이 공용 인터넷에 접근할 수 있게 되었다. 한 테스트에서 CTF 챌린지의 가상 대상 이름이 우연히 실제 도메인과 일치하여, 모델이 실제 웹사이트를 시뮬레이션 환경의 일부로 착각하고 공격하게 되었다. Anthropic의 보고서에도 Irregular가 언급되었는데, 그들이 일부 테스트 중에 Claude에게 실시간 인터넷 접근 권한을 부여한 잘못 구성된 평가 환경을 호스팅했기 때문이다.
출처: Simon Willison —
원문
