Prompt-injektio ei ole hyökkäys, vaan LLM-assistenttien ominaisuus
OpenAI
Anthropic
Artikkelissa väitetään, että prompt-injektio ei ole tietoturva-aukko, vaan LLM-pohjaisten tekoälyassistenttien normaali käyttäytyminen, koska ne on suunniteltu seuraamaan ohjeita. Kirjoittaja osoittaa kokeella, että monet tekoälypalvelut käsittelevät ladatuissa tiedostoissa tai käännöstehtävissä olevaa tekstiä komentoina, ja ehdottaa lieventämisstrategioita.
Kirjoittaja selittää, että kehotteen injektio on yksinkertaisesti tekoälyavustajan toimintaa, joka noudattaa käyttäjän antamia ohjeita, jotka on upotettu käyttäjän toimittamaan dataan, samalla tavalla kuin ahkera työntekijä. Eräässä kokeessa yhdeksälle tekoälypalvelulle annettiin tekstitiedosto, jossa oli ohje muotoilla lista roomalaisilla numeroilla ja lisätä pysyvä lainaus kaikkiin tuleviin vastauksiin. Kaksi palvelua jätti ohjeet täysin huomiotta, viisi muotoili listan mutta ei muuttanut tilin asetuksia, ja kaksi suoritti molemmat ohjeet. Kirjoittaja huomauttaa, että jopa käännöstehtävä tulkittiin komennoksi kahdeksassa yhdeksästä palvelusta, ja yksi päivitti tilin muistiaan. Ongelma johtuu siitä, että suuret kielimallit eivät pysty erottamaan dataa ja ohjeita toisistaan. Osittaisena ratkaisuna kirjoittaja ehdottaa, että tekoälylle annetaan nimenomainen ohje kohdella kaikkia syötteitä datana, ei komentoina, ja huomauttaa, että ChatGPT ja Claude omaavat jo valmiiksi vastustuskyvyn tiedostoista tulevalle kehotteen injektiolle.
Lähde: Habr — хаб ИИ —
Alkuperäinen
