TekoälyturvallisuusTutkimus 🇷🇺 12.08.2026 14:01

Näin tekstiälyn vesileimat toimivat ja miten ne voi kiertää

AnthropicAnthropic Google/DeepMindGoogle/DeepMind DeepSeekDeepSeek
Artikkelissa selitetään, miten suurten kielimallien tuottamaan tekstiin lisätyt vesileimat toimivat – ne ovat EU:n uusien tekoälysäännösten vaatimus – ja tarjotaan käytännön keinoja niiden poistamiseen. Kirjoittaja kuvailee vesileimaukseen käytettyä todennäköisyysjakauman muutosta ja ehdottaa monivaiheista kiertotapaa, jossa teksti käännetään ja kirjoitetaan uudelleen avoimen painon malleilla. Lisäksi hän esittelee itse rakennetun työkalun, joka on toteutettu Streamlit- ja LangChain-kirjastoilla ja joka automatisoi tämän prosessin.
Artikkelin alussa todetaan, että EU:n säädökset edellyttävät nyt suurten kielimallien tarjoajia vesileimaamaan tekoälyn tuottaman tekstin, ja esimerkkinä mainitaan Anthropicin Claude. Kirjoittaja selittää, että vesileimaus toimii muuttamalla tokenien todennäköisyysjakaumaa generoinnin aikana, jolloin tietyt harvinaiset tokenit esiintyvät useammin. Tämä on ihmisille huomaamatonta, mutta koneet, jotka tuntevat todellisen jakauman, voivat havaita sen. Kiertääkseen vesileimat kirjoittaja ehdottaa tekstin esikäsittelyä, jossa poistetaan ilmeiset artefaktit, kuten ajatusviivat ja nollaleveysvälit, sitten tekstin kääntämistä välikielen kautta takaisin ja lopuksi uudelleenkirjoittamista avoimen painon LLM-mallilla, kuten DeepSeek-v4, joka ei lisää vesileimoja. Kirjoittaja on rakentanut Streamlit- ja LangChain-pohjaisen työkalun, joka automatisoi nämä vaiheet, antaa käyttäjille mahdollisuuden valita ja määrittää kunkin vaiheen, ja se on saatavilla GitHubissa.
Lähde: Habr — хаб ИИ — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset