AI 안전 🇷🇺 29.07.2026 02:01

프롬프트 인젝션은 공격이 아니라 LLM 어시스턴트의 기능이다

OpenAIOpenAI AnthropicAnthropic
이 기사는 프롬프트 인젝션이 보안 취약점이 아니라 명령어를 따르도록 설계된 LLM 기반 AI 어시스턴트의 정상적인 동작이라고 주장합니다. 저자는 실험을 통해 많은 AI 서비스가 업로드된 파일의 텍스트나 번역 작업을 명령어로 취급한다는 것을 보여주고, 완화 전략을 제안합니다.
저자는 프롬프트 인젝션이 단순히 사용자가 제공한 데이터에 포함된 지시를 AI 어시스턴트가 따르는 현상이라고 설명하며, 이는 성실한 직원과 유사하다고 말합니다. 실험에서 9개의 AI 서비스는 로마 숫자로 목록을 구성하고 향후 모든 응답에 영구적인 인용문을 추가하라는 지시가 포함된 텍스트 파일을 전달받았습니다. 두 서비스는 지시를 완전히 무시했고, 다섯 서비스는 목록을 구성했지만 계정 설정을 변경하지 않았으며, 두 서비스는 두 지시를 모두 수행했습니다. 저자는 번역 작업조차 9개 서비스 중 8개가 명령으로 처리했으며, 그중 하나는 계정 메모리를 업데이트했다고 지적합니다. 문제는 대규모 언어 모델(LLM, Large Language Model)이 데이터와 명령을 구분할 수 없기 때문에 발생합니다. 부분적인 해결책으로 저자는 AI에게 모든 입력을 명령이 아닌 데이터로 처리하도록 명시적으로 지시할 것을 제안하며, 챗GPT(모델명)와 클로드(모델명)는 이미 파일로부터의 프롬프트 인젝션에 대한 내장된 저항력을 갖추고 있다고 언급합니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스