AI安全性研究 🇷🇺 12.08.2026 14:01

テキストAIのウォーターマークの仕組みと回避方法

AnthropicAnthropic Google/DeepMindGoogle/DeepMind DeepSeekDeepSeek
この記事では、欧州連合(EU)の新しいAI規制で義務付けられた大規模言語モデル(LLM)出力におけるテキスト透かしのメカニズムを説明し、それを除去する実践的な方法を提供します。著者は、透かしに使用される確率的トークン分布のシフトについて詳述し、翻訳とオープンウェイトモデルによる書き換えを含む多段階の回避アプローチを提案します。また、このプロセスを自動化するために、Streamlit と LangChain を使用して構築したカスタムツールも紹介しています。
この記事の冒頭では、EUの規制により、LLMプロバイダーがAI生成テキストに透かしを入れることが義務付けられており、その例としてAnthropicのClaudeが挙げられている。著者は、透かしは生成中にトークンの確率分布をずらし、特定の希少なトークンがより頻繁に出現するようにすることで機能すると説明している。これは人間には知覚できないが、実際の分布を知る機械には検出可能である。透かしを回避するために、著者は、テキストからemダッシュやゼロ幅スペースなどの明らかな痕跡を除去する前処理を行い、テキストを中間言語に翻訳してから元に戻し、最後に透かしを追加しないDeepSeek-v4のようなオープンウェイトのLLMで書き直すことを提案している。著者は、これらのステップを自動化するStreamlitとLangChainに基づくツールを構築し、ユーザーが各ステップを選択・設定できるようにしており、GitHubで公開している。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース