Hoe AI-watermerken in tekst werken en hoe je ze kunt omzeilen
Anthropic
Google/DeepMind
DeepSeek
Het artikel legt het mechanisme uit achter tekstwatermerken in LLM-uitvoer, die verplicht zijn gesteld door recente EU-AI-regelgeving, en biedt praktische methoden om ze te verwijderen. De auteur beschrijft de probabilistische tokenverdeling die wordt gebruikt bij watermerken en stelt een aanpak in meerdere stappen voor om ze te omzeilen, waarbij gebruik wordt gemaakt van vertaling en herschrijving met open-weight-modellen. Ze introduceren ook een zelfgebouwd hulpmiddel, gebouwd met Streamlit en LangChain, om dit proces te automatiseren.
Het artikel begint met op te merken dat EU-regelgeving nu aanbieders van grote taalmodellen verplicht om AI-gegenereerde tekst van een watermerk te voorzien, waarbij het Claude-model van Anthropic als voorbeeld wordt genoemd. De auteur legt uit dat watermerken werken door de kansverdeling van tokens tijdens het genereren te verschuiven, waardoor bepaalde zeldzame tokens vaker voorkomen. Dit is onzichtbaar voor mensen, maar detecteerbaar door machines die de werkelijke verdeling kennen. Om watermerken te omzeilen, stelt de auteur voor om de tekst vooraf te bewerken om duidelijke artefacten zoals em-dashes en nulbreedte-spaties te verwijderen, vervolgens de tekst naar een tussenliggende taal te vertalen en terug, en tot slot de tekst te herschrijven met een opengewichtmodel zoals DeepSeek-v4 dat geen watermerken toevoegt. De auteur heeft een tool gebouwd op basis van Streamlit en LangChain die deze stappen automatiseert, zodat gebruikers elke stap kunnen kiezen en configureren. Deze tool is beschikbaar op GitHub.
Bron: Habr — хаб ИИ —
origineel
