Venäläisten LLM-mallien testaus OWASP LLM10-hyökkäyksiä vastaan: rajoittamaton resurssienkulutus
Яндекс
Сбер
AI Red Team -projektin tutkijat testasivat venäläisiä lippulaivamalleja YandexGPT Lite 5 ja GigaChat Lite OWASP LLM10:n rajoittamattoman resurssienkulutuksen hyökkäyksiä vastaan. He käyttivät erityisesti muokattuja kehotteita laukaisemaan rekursiivisen kontekstin laajentumisen, fraktaalisen sisäkkäisyyden, kombinatorisen räjähdyksen ja multiagenttisimulaatioita lisätäkseen laskennallista kuormitusta. Tutkimus korostaa, että perinteiset puolustuskeinot eivät riitä tällaisia resurssien ehtymiseen tähtääviä hyökkäyksiä vastaan.
Artikkelissa käsitellään OWASP LLM10: Unbounded Consumption -luokkaa, joka keskittyy hyökkäyksiin, jotka pakottavat kielimallit suorittamaan suhteettoman suuren laskentamäärän, mikä johtaa resurssien ehtymiseen ja palvelunestoon. Tutkijat valmistivat haitallisia kehotteita, jotka edustavat erilaisia hyökkäysluokkia, mukaan lukien rekursiivinen kontekstin laajentaminen (Quine-tyyppinen rekursio), fraktaalinen sisäkkäisyys, laskennallinen räjähdys, semanttinen kombinatorinen räjähdys, multi-agenttisimulaatio ja glitch-tokenien väärinkäyttö. Nämä kehotteet voivat saada mallit tuottamaan liian pitkiä vastauksia, simuloimaan tuhansia entiteettejä tai rekursiivisesti analysoimaan omaa päättelyään, kaikki näyttäen laillisilta käyttäjäpyynnöiltä. Tutkimuksessa testattiin kahta venäläistä lippulaiva-LLM:ää, YandexGPT Lite 5 ja GigaChat Lite, käyttäen AI Red Team -verkkopalvelua, joka tukee yli 2000 haitallista kehotetta, joista 200 kohdistuu OWASP LLM10:een. Arviointi sisälsi LLM-tuomarin (LLM-as-a-judge) ja manuaalisen validoinnin. Artikkeli korostaa, että perinteiset turvatoimenpiteet, kuten avainsanasuodatus, ovat tehottomia, ja painottaa vankempien arkkitehtonisten puolustusmekanismien tarvetta.
Lähde: Habr — хаб ИИ —
Alkuperäinen
