근본적인 결함으로 인해 LLM이 공격에 취약해져
OpenAI
Anthropic
Alibaba/Qwen
DeepSeek
연구진들은 대규모 언어 모델(LLM)에 근본적인 결함이 있어 해킹에 매우 취약하다고 주장합니다. LLM이 명령어 출처를 식별하는 방식을 악용함으로써, 공격자들은 LLM을 속여 약물 합성이나 항공기 방해 지침과 같은 금지된 정보를 유출하도록 할 수 있습니다.
국제기계학습학회(ICML)에서 독립 연구원인 찰스 예와 재스민 쿠이가 발표한 논문은 대규모 언어 모델(LLM)의 근본적인 결함을 밝혀내며, 이 결함으로 인해 LLM이 공격에 취약해진다고 주장합니다. 이 결함은 LLM이 명령을 내리는 주체나 대상을 식별하는 방식과 관련되어 있으며, 이를 통해 공격자가 LLM을 속여서 코카인 합성 방법 안내나 항공기 항법 시스템 방해 등 해서는 안 되는 행동을 하게 만들 수 있습니다. 연구자들은 LLM이 텍스트의 역할을 태그가 아닌 스타일로 식별하기 때문에 공격자가 역할을 위조할 수 있다는 사실을 발견했습니다. 그들은 오픈AI, 앤트로픽, 알리바바, 딥시크의 모델에 대해 사고 연쇄 위조 공격을 시연했습니다. 연구자들은 이 문제가 근본적으로 해결 불가능하며, 아무리 많은 훈련을 해도 완전히 해결할 수 없다고 주장합니다. 그들은 LLM이 충분한 기초 연구 없이 중요한 시스템에 배치되고 있다고 경고합니다.
출처: MIT Technology Review —
원문
