GPT-Red: OpenAI:n automaattinen red teaming itsensä parantavaan tekoälyn turvallisuuteen
OpenAI
OpenAI esitteli GPT-Red-järjestelmän, automaattisen red teaming -järjestelmän, joka käyttää itsepelaamismenetelmää parantaakseen suurten kielimallien turvallisuutta, yhdenmukaisuutta ja kestävyyttä prompt injection -hyökkäyksiä vastaan. Järjestelmä antaa mallin luoda autonomisesti hyökkäysskenaarioita ja hienosäätää niitä, parantaen sen kestävyyttä ilman jatkuvaa ihmisen väliintuloa.
OpenAI on julkaissut GPT-Red-järjestelmän, automatoidun punaisen tiimin työkalun, joka on suunniteltu parantamaan tekoälyn turvallisuutta, linjausta ja kestävyyttä. Järjestelmä käyttää itsepelioppimismenetelmää, jossa malli luo itsenäisesti hyökkäyskyselyitä ja haitallisia skenaarioita ja hienosäätää sitten itseään niiden avulla parantaakseen puolustustaan. Tämä lähestymistapa mahdollistaa mallin kestävyyden jatkuvan parantamisen ilman, että ihmistestaajia tarvitaan jatkuvasti. GPT-Red on erityisen tehokas havaitsemaan ja lieventämään prompt-injektiohaavoittuvuuksia, joissa hyökkääjä yrittää ohittaa mallin rajoitukset erityisesti muotoiltujen kyselyiden avulla. Järjestelmä arvioi automaattisesti hyökkäysten tulokset ja käyttää niitä mallin käyttäytymisen säätämiseen, mikä tekee turvallisuuden parantamisprosessista skaalautuvamman ja tehokkaamman.
Lähde: OpenAI —
Alkuperäinen
