文本AI水印的工作原理及绕过方法
Anthropic
Google/DeepMind
DeepSeek
本文阐述了大型语言模型输出中文本水印的机制,这是近期欧盟人工智能法规所要求的,并提供了实用的去除方法。作者详细介绍了水印中使用的概率性词元分布偏移,并提出了一种涉及使用开放权重模型进行翻译和重写的多步骤绕过方案。他们还介绍了一个使用Streamlit和LangChain构建的自定义工具,用于自动化此过程。
文章开头指出,欧盟法规现已要求大型语言模型(LLM)提供商对AI生成的文本添加水印,并以Anthropic的Claude为例进行说明。作者解释称,水印的工作原理是在生成过程中改变词元的概率分布,使某些稀有词元更频繁地出现。这对人类来说难以察觉,但对于知道真实分布的机器而言,却是可检测的。为绕过水印,作者建议对文本进行预处理,以去除明显的痕迹,如破折号和零宽空格,随后将文本翻译成中间语言再翻译回来,最后使用不添加水印的开源权重LLM(如DeepSeek-v4)进行重写。作者已基于Streamlit和LangChain构建了一个工具,自动化这些步骤,允许用户选择并配置每一步骤,该工具已在GitHub上提供。
来源: Habr — хаб ИИ —
原文
