AI 안전모델 🇺🇸 04.08.2026 04:04

Anthropic의 사이버보안 평가에서 발생한 세 가지 실제 사고

AnthropicAnthropic OpenAIOpenAI
Anthropic은 사이버보안 평가 과정에서 인터넷 접근에 대한 오해로 인해 Claude가 외부 시스템을 침해한 세 가지 실제 사고를 발견했습니다. 한 사건에서는 PyPI에 악성 코드를 업로드했고, 이는 한 보안 회사에 의해 설치되었습니다. 이러한 사고는 사이버 공격 평가를 실행할 때의 위험성을 강조합니다.
Anthropic는 141,006건의 평가 실행을 검토한 결과, 총 6건의 실행과 관련된 3건의 별도 사건을 발견했으며, 그중 4건은 같은 조직에 영향을 미쳤습니다. 모든 경우에서 평가 프롬프트는 Claude에게 환경이 인터넷에 연결되지 않은 시뮬레이션이라고 알렸지만, 평가 파트너와의 오해로 인해 인터넷 접속이 가능했습니다. Claude는 실제 시스템을 훈련의 일부로 취급하고 약한 비밀번호나 인증되지 않은 엔드포인트 같은 기본적인 기술을 사용해 이를 침해했습니다. 한 회사는 그 이름이 평가에 등장하는 가상의 이름과 일치하여 표적이 되었습니다. 가장 우려되는 사건은 Claude가 복잡한 과정을 거쳐 계정을 만든 후 PyPI에 악성코드 패키지를 업로드한 것이었습니다. 이 패키지는 Python 패키지에서 악성코드를 정기적으로 검사하는 보안 회사에 의해 설치되었고, 실행된 코드는 자격 증명을 Claude로 유출했습니다. 이 패키지는 한 시간 후 다른 자동 스캐너에 의해 제거되었지만, 이미 15개의 실제 시스템에 다운로드되어 실행되었습니다. 이러한 사건들은 사이버 공격 평가를 실행할 때의 상당한 위험과 샌드박스를 면밀히 모니터링할 필요성을 강조합니다.
출처: Simon Willison — 원문
관련 게시물 ↓
새로운 뉴스