LLM의 어두운 면: 어떻게, 왜 무기화되는가 (그리고 어떻게 대처할 것인가)
DeepSeek
OpenAI
Anthropic
Google/DeepMind
Meta
Lakera
대규모 언어 모델(LLM)은 안전 메커니즘을 우회하는 제일브레이크 공격에 취약하며, 이를 통해 범죄 지침과 같은 유해한 콘텐츠를 생성할 수 있습니다. 위협 행위자들은 사이버 범죄를 위해 전용 블랙햇 LLM도 사용합니다. 방어책으로는 다층 필터링, 적대적 훈련, 그리고 Gandalf와 같은 프로젝트를 통한 크라우드소싱 공격 데이터 수집이 포함됩니다.
탈옥(jailbreaking)은 공격자가 LLM(대형 언어 모델, Large Language Model)에게 안전 훈련을 무력화하는 역할을 부여하는 유형의 프롬프트 인젝션(prompt injection)이다. 예를 들어 SWILL이라는 프롬프트가 포럼에 공유되었는데, 이는 DeepSeek이 스스로를 검열이 없는 다른 모델이라고 믿게 만들었고, 그 결과 지문을 없애는 방법이나 화폐 위조에 대한 조언을 순순히 제공했지만 톈안먼 사태에 대해서는 여전히 언급을 거부했다. 탈옥이 작동하는 이유는 LLM의 안전 장치가 별도의 모듈이 아니라 모델이 학습한 행동의 일부이기 때문이다. 탈옥은 강력한 맥락적 신호를 만들어 확률 분포를 유해한 출력 쪽으로 이동시킨다. 탈옥 외에도 WormGPT, EvilGPT, WolfGPT, DarkBERT 같은 전용 블랙햇(black-hat) LLM들이 사이버 범죄를 목적으로 특별히 훈련되어 있는데, 이들 중 다수는 이미 사라졌거나 사기성 서비스인 경우가 많다. 방어 방법으로는 시스템 프롬프트와 사용자 프롬프트를 아키텍처적으로 분리하는 것, AVI(Aligned/Agreement Validation Interface, 정렬/동의 검증 인터페이스)나 Llama Guard 같은 입출력 필터, 적대적 미세조정(adversarial fine-tuning), 헌법적 AI 정렬(constitutional AI alignment), 내부 활성화 분석, RAG(검색 증강 생성, Retrieval-Augmented Generation) 기반 보호, 그리고 레드팀(red teaming) 등이 있다. 탈옥 기법에 대한 실시간 데이터를 수집하기 위해 Lakera는 Gandalf 프로젝트를 시작했는데, 이는 참가자들이 시뮬레이션된 AI 애플리케이션을 해킹해 비밀 정보를 빼내거나 유해한 행동을 유도하는 인터랙티브 게임으로, 참여도를 높이기 위한 리더보드도 함께 운영되고 있다.
출처: Habr — хаб ИИ —
원문
