Como Funcionam as Marcas d'Água em Texto de IA e Como Contorná-las
Anthropic
Google/DeepMind
DeepSeek
O artigo explica o mecanismo por trás das marcas d'água em textos gerados por modelos de linguagem, exigidas por regulamentações recentes da União Europeia sobre IA, e oferece métodos práticos para removê-las. O autor detalha a mudança na distribuição probabilística de tokens usada na marcação e sugere uma abordagem de contorno em várias etapas, envolvendo tradução e reescrita com modelos de pesos abertos. Eles também apresentam uma ferramenta personalizada desenvolvida com Streamlit e LangChain para automatizar esse processo.
O artigo começa observando que as regulamentações da União Europeia agora exigem que provedores de Grandes Modelos de Linguagem (LLMs, na sigla em inglês) marquem textos gerados por IA com marca d'água, citando o exemplo do Claude, da Anthropic. O autor explica que a marca d'água funciona ao deslocar a distribuição de probabilidade dos tokens durante a geração, fazendo com que certos tokens raros apareçam com mais frequência. Isso é imperceptível para humanos, mas detectável por máquinas que conhecem a distribuição real. Para contornar as marcas d'água, o autor sugere pré-processar o texto para remover artefatos óbvios, como travessões e espaços de largura zero, e então traduzir o texto para um idioma intermediário e de volta, e finalmente reescrever com um LLM de pesos abertos, como o DeepSeek-v4, que não adiciona marcas d'água. O autor construiu uma ferramenta baseada em Streamlit e LangChain que automatiza essas etapas, permitindo que os usuários escolham e configurem cada passo, e ela está disponível no GitHub.
Fonte: Habr — хаб ИИ —
original
