AI 안전연구 🇺🇸 27.07.2026 17:06

StruQ와 SecAlign: 프롬프트 인젝션 공격 방어

MetaMeta OpenAIOpenAI
BAIR 연구진이 LLM 통합 애플리케이션에서 프롬프트 인젝션 공격을 방어하기 위해 두 가지 미세 조정 방어 기법인 StruQ와 SecAlign을 제안했습니다. StruQ는 구조화된 명령 튜닝을 사용해 주입된 명령을 무시하고, SecAlign은 선호도 최적화를 적용하여 강건성을 향상시켜 최적화가 없는 공격에 대해 공격 성공률을 거의 0%로, 최적화 기반 공격에 대해 15% 미만으로 낮춥니다.
프롬프트 인젝션은 신뢰할 수 없는 데이터에 시스템의 의도된 프롬프트를 무효화하는 명령이 포함되는 공격으로, OWASP에서 LLM 통합 애플리케이션의 가장 위협적인 요소로 지목하고 있다. Google Docs, Slack AI, ChatGPT와 같은 프로덕션 수준 시스템이 취약한 것으로 나타났다. 연구진은 원인으로 프롬프트와 데이터 간의 분리 부족과 LLM이 입력 어디에든 있는 명령을 따르도록 훈련된 점을 제시한다. 이에 대응하기 위해 특수 토큰을 사용해 프롬프트와 데이터를 구분하고 데이터 내 구분자를 필터링하는 Secure Front-End를 도입했다. StruQ(Structured Instruction Tuning)는 훈련 중 프롬프트 인젝션을 시뮬레이션하여 LLM이 데이터 부분에 주입된 명령을 무시하도록 학습시킨다. SecAlign(Special Preference Optimization)은 바람직한 응답과 바람직하지 않은 응답 모두에 대해 훈련하며, 선호도 최적화를 통해 이들 간의 큰 확률 차이를 만든다. Llama3-8B-Instruct 실험에서 StruQ는 공격 성공률(ASR)을 45%로 낮추고, SecAlign은 정교한 공격에 대해 ASR을 8%로 추가 감소시켰다. SecAlign은 AlpacaEval2로 측정한 유용성을 유지하는 반면, StruQ는 4.5% 감소시켰다. 두 방법 모두 최적화 없는 공격 성공률을 거의 0%로 낮췄으며, SecAlign은 최적화 기반 공격 ASR을 이전 최신 기술 대비 4배 이상 감소시켰다.
출처: BAIR (Berkeley AI) — 원문
관련 게시물 ↓
새로운 뉴스