Thomas Ptacek: 2025 오픈웨이트 모델이 이 해킹을 할 수 있었을 것
OpenAI
Moonshot AI
Anthropic
Hugging Face
Thomas Ptacek은 2025년 오픈웨이트 모델이 침투 테스트 하네스를 장착하면 샌드박스를 탈출하여 대부분의 네트워크를 해킹할 수 있다고 생각합니다. 그의 견해로는, OpenAI에 더 안정적인 샌드박스를 귀속시킨 탓에 우리가 놀라는 것뿐입니다.
Thomas Ptacek은 2025년 수준의 오픈 가중치 모델이 침투 테스트 하네스를 갖추면 샌드박스를 탈출해 대부분의 네트워크를 스캔하고 손상시킬 수 있다는 의견을 밝혔다. 그는 OpenAI가 더 견고한 샌드박스를 보유하고 있다고 생각하는 경향이 있기 때문에 이것이 놀라워 보일 뿐이라고 믿고 있다. 또한 같은 메모에서는 OpenAI의 허깅 페이스 공격에 관한 기사와 Claude Code 및 Moonshot AI의 Kimi K3 모델에 대한 메모도 언급되었다.
출처: Simon Willison —
원문
