Как работают водяные знаки текстового ИИ и как их обойти
В статье объясняется механизм водяных знаков в выводах больших языковых моделей (LLM), требуемых недавними нормативами ЕС по ИИ, и предлагаются практические способы их удаления. Автор подробно описывает вероятностное смещение распределения токенов, используемое для встраивания водяных знаков, и предлагает многоэтапный подход к обходу, включающий перевод и переписывание с помощью моделей с открытым весом. Также они представляют пользовательский инструмент, созданный с помощью Streamlit и LangChain для автоматизации этого процесса.
Статья начинается с того, что требования Европейского союза (ЕС) теперь обязывают поставщиков больших языковых моделей (БЯМ) наносить водяные знаки на текст, сгенерированный искусственным интеллектом (ИИ), — в качестве примера упоминается Claude от Anthropic. Автор объясняет, что нанесение водяных знаков работает за счёт смещения распределения вероятностей токенов при генерации, благодаря чему
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
