AI 안전모델 🇷🇺 24.07.2026 11:01

프롬프트 인젝션은 필터로 해결되지 않는다: 아키텍처 패턴을 사용하여 신뢰할 수 없는 텍스트를 격리하는 방법

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
프롬프트 인젝션은 LLM 애플리케이션의 구조적 결함으로 남아 있으며, 시스템 프롬프트나 분류기로 해결되지 않습니다. Dual-LLM, Google DeepMind의 CaMeL, Meta의 Agents Rule of Two와 같은 아키텍처 패턴은 강력한 격리를 제공합니다. 이 기사는 위협 모델, Microsoft 365 Copilot의 EchoLeak 취약점, 그리고 세 개의 격리된 모델을 사용한 구체적인 구현을 자세히 설명합니다.
Simon Willison이 2022년 9월에 소개한 프롬프트 인젝션은, LLM 컨텍스트 내의 신뢰할 수 없는 텍스트가 명령어로 실행될 때 발생합니다. 탈옥(jailbreaking)과 달리, 모델이 도구와 데이터에 접근할 수 있는 애플리케이션에 영향을 미쳐 혼란스러운 부하(confused deputy) 공격과 데이터 탈취(data exfiltration) 공격으로 이어집니다. 이 글은 시스템 프롬프트와 가드레일 분류기가 효과적이지 않다고 주장하며, OpenAI, Anthropic, Google DeepMind가 2025년에 발표한 연구를 인용해 적응형 공격이 12개의 발표된 방어책을 90% 이상의 성공률로 우회했다고 밝힙니다. Simon Willison의 '치명적 삼박자(lethal trifecta)'는 데이터 탈취를 위한 세 가지 요소, 즉 비공개 데이터에 대한 접근, 신뢰할 수 없는 콘텐츠와의 접촉, 외부 채널을 식별합니다. Microsoft 365 Copilot의 EchoLeak 취약점(CVE-2025-32711)은 이 세 가지를 모두 악용했습니다. Meta의 '에이전트 두 가지 규칙(Agents Rule of Two)'은 에이전트가 세 가지 속성 중 두 가지 이하만 가져야 한다고 명시합니다: 신뢰할 수 없는 입력 처리, 민감한 시스템/데이터에 대한 접근, 상태 변경 또는 외부 통신 능력. 이중 LLM(Dual-LLM) 아키텍처(Willison, 2023)는 특권 LLM(도구를 가지며 신뢰할 수 있는 입력만 처리)과 격리된 LLM(도구가 없으며 신뢰할 수 없는 텍스트 처리)을 분리하고, 결정론적 컨트롤러로 연결합니다. Google DeepMind의 CaMeL(2024)은 검증기를 사용해 격리된 모델이 엄격한 하위 집합의 허용된 토큰만 출력하도록 강제합니다. 2025년 논문의 여섯 가지 프로젝트 패턴이 이 아이디어를 확장합니다. FAQ 생성기를 위해 세 개의 격리된 모델을 사용한 구체적인 구현이 설명됩니다: 하나는 회사 데이터와 도구에 접근할 수 있는 특권 모델, 하나는 신뢰할 수 없는 페이지 텍스트를 위한 격리 모델, 하나는 합성을 위한 모델이며, 이들 사이에 결정론적 검사가 있습니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스