내가 AI를 다크 사이드로 돌린 방법: 주요 LLM의 체계적 취약점
OpenAI
Anthropic
DeepSeek
Google/DeepMind
Meta
Microsoft
Mistral
xAI
연구자 Dave Kuszmar는 주요 LLM에서 여러 체계적 취약점을 발견하여 안전 조치를 우회하고 위험한 지침을 얻을 수 있었습니다. 이러한 익스플로잇은 거의 모든 주요 LLM에서 작동하여 업계 전반의 보안 문제를 드러냈습니다. Kuszmar는 배포 속도 완화, 투명성 증대, 대규모 LLM 안전 연구를 촉구합니다.
전 사이버보안 디렉터였던 연구원 데이브 커즈마(Dave Kuszmar)는 타임 밴디트(Time Bandit)와 인셉션(Inception)과 같은 기법을 이용해 주요 대규모 언어 모델(LLM)의 안전 제한을 우회할 수 있다는 사실을 발견했습니다. 타임 밴디트는 LLM이 현재 시간을 인식하지 못하는 점을 악용해 과거 법률이 적용되는 환경에서 작동하도록 만들고, 인셉션은 중첩된 시나리오를 사용해 모델이 유해한 출력을 생성하도록 속입니다. 이러한 공격은 OpenAI의 GPT-4o, Anthropic의 Claude, DeepSeek, Google의 Gemini, Meta의 Llama, Microsoft의 Copilot, Mistral의 Le Chat, xAI의 Grok 등을 포함한 모델에 적용되었습니다. 커즈마는 네이팜, 메스암페타민, 심지어 핵무기용 우라늄 농축 시설을 만드는 방법에 대한 지침을 얻을 수 있었습니다. 이러한 취약점을 OpenAI, CIA, FBI 및 기타 기관에 신고했지만 거의 응답을 받지 못했습니다. 취약점은 Bleeping Computer에 의해 최종 확인되었고, 카네기멜런 대학교 소프트웨어 공학 연구소의 컴퓨터 비상 대응 팀(SEI CERT)에 보고되었습니다.
출처: IEEE Spectrum AI —
원문
