TekoälyturvallisuusTutkimus 🇺🇸 27.07.2026 17:06

StruQ ja SecAlign: Suojautuminen promptinjektiohyökkäyksiltä

MetaMeta OpenAIOpenAI
BAIRin tutkijat ehdottavat kahta hienosäätöön perustuvaa puolustusmenetelmää, StruQ:ta ja SecAligniä, promptinjektiohyökkäyksiä vastaan LLM-integroiduissa sovelluksissa. StruQ käyttää rakenteellista ohjehienosäätöä injektoitujen ohjeiden huomiotta jättämiseksi, kun taas SecAlign soveltaa preferenssioptimointia paremman robustisuuden saavuttamiseksi, vähentäen hyökkäysten onnistumisprosentit lähelle nollaa optimoimattomissa hyökkäyksissä ja alle 15 prosenttiin optimointipohjaisissa hyökkäyksissä.
Kehotteeninjektio, jossa epäluotettava data sisältää ohjeen, joka ohittaa järjestelmän tarkoitetun kehotteen, on OWASP:n listauksessa ykkösuhka LLM-integraatiota hyödyntäville sovelluksille. Tuotantotason järjestelmien, kuten Google Docsin, Slack AI:n ja ChatGPT:n, on osoitettu olevan haavoittuvaisia. Kirjoittajat esittävät kaksi syytä: kehotteen ja datan erottelun puute sekä LLM:ien kouluttaminen noudattamaan ohjeita missä tahansa syötteen osassa. Näiden korjaamiseksi he esittelevät Secure Front-Endin, joka käyttää erikoismerkkejä erottamaan kehotteen ja datan, suodattaen pois kaikki erotinmerkit datasta. StruQ (Structured Instruction Tuning) simuloi kehotteinjektioita koulutuksen aikana opettaen LLM:ää jättämään huomiotta injektoidut ohjeet dataosassa. SecAlign (Special Preference Optimization) menee pidemmälle kouluttamalla sekä toivottuihin että ei-toivottuihin vastauksiin, käyttäen preferenssioptimointia suuren todennäköisyyseron luomiseksi niiden välille. Kokeet Llama3-8B-Instruct-mallilla osoittavat, että StruQ vähentää hyökkäyksen onnistumisprosentin (Attack Success Rate, ASR) 45 prosenttiin, ja SecAlign vähentää sen edelleen 8 prosenttiin kehittyneitä hyökkäyksiä vastaan. SecAlign säilyttää hyödyllisyyden AlpacaEval2:lla mitattuna, kun taas StruQ heikentää sitä 4,5 prosentilla. Molemmat vähentävät optimoimattomien hyökkäysten onnistumisprosentit lähes nollaan, ja SecAlign vähentää optimointiin perustuvien hyökkäysten ASR:ää yli nelinkertaisesti aiempaan huipputulokseen verrattuna.
Lähde: BAIR (Berkeley AI) — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset