An toàn AINghiên cứu 🇷🇺 12.08.2026 14:01

Cách hoạt động của watermark văn bản AI và cách vượt qua chúng

AnthropicAnthropic Google/DeepMindGoogle/DeepMind DeepSeekDeepSeek
Bài viết giải thích cơ chế đằng sau watermark văn bản trong đầu ra của mô hình ngôn ngữ lớn (LLM), được yêu cầu bởi các quy định AI gần đây của Liên minh Châu Âu, và cung cấp các phương pháp thực tế để loại bỏ chúng. Tác giả mô tả sự thay đổi phân phối token xác suất được sử dụng trong watermarking và đề xuất phương pháp vượt qua đa bước liên quan đến dịch và viết lại bằng các mô hình trọng số mở. Họ cũng giới thiệu một công cụ tùy chỉnh được xây dựng bằng Streamlit và LangChain để tự động hóa quy trình này.
Bài viết mở đầu bằng nhận định rằng các quy định của Liên minh châu Âu (European Union – EU) hiện nay yêu cầu các nhà cung cấp mô hình ngôn ngữ lớn (Large Language Model – LLM) phải gắn thủy vân (watermark) cho văn bản do trí tuệ nhân tạo (Artificial Intelligence – AI) tạo ra, và lấy Claude của Anthropic làm ví dụ. Tác giả giải thích rằng thủy vân hoạt động bằng cách dịch chuyển phân phối xác suất của các token trong quá trình sinh văn bản, khiến một số token hiếm xuất hiện với tần suất cao hơn bình thường. Con ngưới không thể nhận ra điều này, nhưng những cỗ máy nắm rõ phân phối thực thì có thể phát hiện. Để vượt qua thủy vân, tác giả đề xuất tiền xử lý văn bản nhằm loại bỏ những dấu vết dễ nhận biết như dấu gạch dài (em dash) và dấu cách độ rộng bằng không (zero-width space), sau đó dịch văn bản sang một ngôn ngữ trung gian rồi dịch ngược trở lại, và cuối cùng viết lại bằng một LLM trọng số mở (open-weight) như DeepSeek-v4 — loại mô hình không thêm thủy vân. Tác giả đã xây dựng một công cụ dựa trên Streamlit và LangChain để tự động hóa các bước trên, cho phép ngưới dùng lựa chọn và tùy chỉnh từng bước; công cụ này hiện được phát hành trên GitHub.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới