Keamanan AIRiset 🇷🇺 12.08.2026 14:01

Cara Kerja Watermark Teks AI dan Cara Mengakalinya

AnthropicAnthropic Google/DeepMindGoogle/DeepMind DeepSeekDeepSeek
Artikel ini menjelaskan mekanisme di balik watermark teks pada keluaran model bahasa besar (LLM), yang diwajibkan oleh regulasi AI terbaru Uni Eropa, dan menawarkan metode praktis untuk menghapusnya. Penulis merinci pergeseran distribusi token probabilistik yang digunakan dalam watermarking dan menyarankan pendekatan bypass multi-langkah yang melibatkan penerjemahan dan penulisan ulang dengan model open-weight. Mereka juga memperkenalkan alat khusus yang dibuat dengan Streamlit dan LangChain untuk mengotomatiskan proses ini.
Artikel ini diawali dengan mencatat bahwa peraturan Uni Eropa kini mewajibkan penyedia model bahasa besar (LLM) untuk memberi tanda air pada teks yang dihasilkan oleh kecerdasan buatan, dengan menyebut Claude milik Anthropic sebagai contoh. Penulis menjelaskan bahwa pemberian tanda air bekerja dengan menggeser distribusi probabilitas token selama proses pembuatan, sehingga token-token yang jarang muncul lebih sering. Hal ini tidak terlihat oleh manusia, tetapi dapat dideteksi oleh mesin yang mengetahui distribusi aslinya. Untuk melewati tanda air, penulis menyarankan untuk memproses teks terlebih dahulu untuk menghilangkan artefak yang jelas seperti em dash dan spasi zero-width, kemudian menerjemahkan teks ke bahasa perantara dan kembali lagi, dan akhirnya menulis ulang dengan model bahasa besar sumber terbuka seperti DeepSeek-v4 yang tidak menambahkan tanda air. Penulis telah membangun alat yang berbasis pada Streamlit dan LangChain yang mengotomatiskan langkah-langkah ini, memungkinkan pengguna untuk memilih dan mengonfigurasi setiap langkah, dan alat tersebut tersedia di GitHub.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru