Sécurité de l'IARecherche 🇷🇺 12.08.2026 14:01

Comment fonctionnent les filigranes de texte par IA et comment les contourner

AnthropicAnthropic Google/DeepMindGoogle/DeepMind DeepSeekDeepSeek
L'article explique le mécanisme des filigranes de texte dans les sorties des grands modèles de langage, exigés par les récentes réglementations européennes sur l'IA, et propose des méthodes pratiques pour les supprimer. L'auteur détaille le décalage de distribution probabiliste des jetons utilisé pour le filigranage et suggère une approche de contournement en plusieurs étapes, impliquant la traduction et la réécriture avec des modèles à poids ouverts. Il présente également un outil personnalisé construit avec Streamlit et LangChain pour automatiser ce processus.
L'article commence en notant que les réglementations de l'UE exigent désormais que les fournisseurs de LLM filigranent les textes générés par l'IA, en citant Claude d'Anthropic comme exemple. L'auteur explique que le filigrane fonctionne en modifiant la distribution de probabilité des jetons lors de la génération, ce qui fait apparaître plus souvent certains jetons rares. Cela est imperceptible pour les humains mais détectable par des machines qui connaissent la distribution réelle. Pour contourner les filigranes, l'auteur suggère de prétraiter le texte pour éliminer les artefacts évidents comme les tirets cadratins et les espaces de largeur nulle, puis de traduire le texte dans une langue intermédiaire et inversement, et enfin de réécrire avec un LLM open-weight comme DeepSeek-v4 qui n'ajoute pas de filigranes. L'auteur a construit un outil basé sur Streamlit et LangChain qui automatise ces étapes, permettant aux utilisateurs de choisir et de configurer chaque étape, et il est disponible sur GitHub.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches