TutkimusTekoälyturvallisuus 🇺🇸 27.07.2026 11:06

Uusi kehys koneoppimisen unohtamisen auditoinnille

Google/DeepMindGoogle/DeepMind
Googlen tutkijat esittelivät Regularized f-Divergence Kernel Tests -menetelmän, uuden kehyksen koneoppimisen unohtamisen auditoinnille, joka mahdollistaa tilastollisesti robustin vahvistuksen siitä, onko malli unohtanut luottamuksellista dataa. Menetelmä ratkaisee perinteisiin testeihin liittyviä ongelmia, kuten herkkyyden menetystä suurissa malleissa ja vääriä positiivisia tuloksia. Kehystä on testattu onnistuneesti synteettisellä datalla, korkeaenergiafysiikan tehtävissä, differentiaalisen yksityisyyden auditoinnissa ja unohtamisen arvioinnissa.
Google esittelee uuden Regularized f-Divergence Kernel Tests -nimisen viitekehyksen, joka on suunniteltu koneoppimisen poiston auditointiin. Koneoppimisen poisto mahdollistaa tekoälyjärjestelmille tiettyjen osien unohtamisen harjoitusdatasta ilman täyttä uudelleenkoulutusta, mikä on ratkaisevan tärkeää sääntelyn noudattamisen kannalta (esimerkiksi oikeus tulla unohdetuksi yleisen tietosuoja-asetuksen eli GDPR:n mukaan), tekoälyn turvallisuudelle ja mallin laadulle. Perinteinen varmennusmenetelmä on kahden otoksen testi, joka vertaa malli, joka ei ole koskaan nähnyt tietuetta, ja malli, joka on 'unohtanut' sen, tuotosten jakaumia. Mallien kasvaessa tämä menetelmä kuitenkin menettää tilastollisen voimansa ja vaatii valtavan määrän näytteitä, mikä tekee siitä laskennallisesti kalliin. Uusi viitekehys, joka esiteltiin 26. kansainvälisessä tekoälyn ja tilastotieteen konferenssissa vuonna 2026 (AISTATS 2026), käyttää regularisoituja testejä, jotka perustuvat f-divergensseihin, ja valitsee automaattisesti parhaan divergenssin ja hyperparametrit, poistaen manuaalisen virityksen tarpeen. Kirjoittajat todistavat teoreettisesti, että testit hallitsevat vääriä positiivisia tuloksia millä tahansa otoskoolla, ja väärien negatiivisten riski lähenee nollaa datan kasvaessa. Viitekehys tarjoaa myös suhteellisen kolmen otoksen testin, joka vertaa unohtavaa mallia turvallisesti uudelleenkoulutettuun malliin ja alkuperäiseen vaarantuneeseen malliin, vastaten täydellisen uudelleenkoulutusvastaavuuden saavuttamisen mahdottomuuteen. Kokeissa synteettisellä datalla, korkean energian fysiikan datalla (harvinaisten hiukkasten etsintä), differentiaalisen yksityisyyden auditoinnissa ja unohtamismenetelmien arvioinnissa viitekehys ylitti tai vastasi perusmenetelmiä vaatien vähemmän näytteitä ja vähemmän viritystä. Esimerkiksi yksityisyyden auditoinnissa hockey-stick divergenssitesti havaitsi rikkomuksia SVT3-mekanismissa käyttäen useita tuhansia näytteitä, kun taas DP-Auditorium vaati miljoonia. Unohtamisen arvioinnissa vain satunnainen etikettimenetelmä läpäisi testin, kun taas hienosäätö, karsinta ja Selective Synaptic Dampening osoittautuivat tehottomiksi. Kirjoittajat korostavat, että he käyttivät yksinkertaistettuja toteutuksia; tuotantoympäristöihin tarvitaan tiukempia asetuksia. Tämä työ tehtiin yhdessä Antonín Schrabin ja Arthur Grettonin kanssa.
Lähde: Google Research — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset