AI 안전연구 🇷🇺 12.08.2026 14:01

텍스트 AI 워터마크의 작동 원리와 우회 방법

AnthropicAnthropic Google/DeepMindGoogle/DeepMind DeepSeekDeepSeek
이 기사는 최근 EU AI 규정에 따라 요구되는 LLM 출력물의 텍스트 워터마크 메커니즘을 설명하고, 이를 제거하는 실용적인 방법을 제시합니다. 저자는 워터마킹에 사용되는 확률적 토큰 분포 이동을 자세히 설명하고, 오픈웨이트 모델을 사용한 번역 및 재작성을 포함한 다단계 우회 접근법을 제안합니다. 또한, 이 과정을 자동화하기 위해 Streamlit과 LangChain으로 구축한 사용자 정의 도구를 소개합니다.
이 기사는 유럽연합(European Union, EU)의 규정에 따라 이제 대규모 언어 모델(Large Language Model, LLM) 제공업체가 인공지능(AI)으로 생성된 텍스트에 워터마크를 삽입해야 한다는 점을 짚으며 시작하며, 그 예로 Anthropic의 Claude를 든다. 저자는 워터마킹이 텍스트 생성 과정에서 토큰의 확률 분포를 바꿔 특정 희귀 토큰이 더 자주 등장하도록 만드는 방식으로 작동한다고 설명한다. 이는 사람에게는 감지되지 않지만, 실제 분포를 알고 있는 기계라면 탐지해 낼 수 있다. 워터마크를 우회하기 위해 저자는 먼저 엠 대시(em dash)나 제로 너비 공백(zero-width space)처럼 눈에 잘 띄는 흔적을 제거하도록 텍스트를 전처리한 뒤, 중간 언어로 번역했다가 다시 원래 언어로 번역하고, 마지막으로 워터마크를 삽입하지 않는 DeepSeek-v4 같은 오픈 웨이트 LLM으로 글을 다시 작성할 것을 제안한다. 저자는 Streamlit과 LangChain을 기반으로 이러한 단계를 자동화하는 도구를 만들었으며, 사용자가 각 단계를 선택하고 설정할 수 있도록 했다. 이 도구는 GitHub에서 이용할 수 있다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스