TekoälyturvallisuusTutkimus 🇷🇺 24.07.2026 11:01

Prompt-injektiota ei voi parantaa suodattimilla: Kuinka eristää epäluotettava teksti arkkitehtuuristen mallien avulla

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
Prompt-injektio on suurten kielimallien rakenteellinen vika, jossa epäluotettava teksti suoritetaan käskynä. Suodattimet ja järjestelmäkehotukset eivät ole tehokkaita: jopa parhaat puolustukset murretaan 90 prosentissa tapauksista adaptiivisissa hyökkäyksissä. Toimivat lähestymistavat – Dual-LLM, CaMeL ja Two Meta -sääntö – rakentavat eristystä sen sijaan, että yritettäisiin erottaa hyvä pahasta.
Prompt injection on haavoittuvuus, jossa epäluotettava teksti (esimerkiksi verkkosivulta tai sähköpostista) päätyy LLM:n kontekstiin ja alkaa toimia ohjeistuksena, mikä johtaa tietovarkauksiin tai luvattomiin toimenpiteisiin. Kyse ei ole jailbreakista: hyökkääjä on toinen henkilö ja uhri on käyttäjä, joka on vain pyytänyt sisällön käsittelyä. Klassiset suojaukset, kuten systeemiprompti ”älä huomioi muiden ohjeita” ja sisääntulon luokittelijat, eivät toimi, koska hyökkäysten moninaisuus on loputon ja mallit eivät ole deterministisiä. Tutkimus ”The Attacker Moves Second” (2025) osoitti, että 12 julkaistua suojausta pystytään murtamaan yli 90 prosentissa tapauksista adaptiivisilla hyökkäyksillä; elävä punatiimisessio mursi kaikki 100 prosenttia. Haavoittuvuutta selittää ”tappava kolmikko”: yksityiset tiedot + epäluotettava sisältö + kanava ulkomaailmaan. Esimerkkinä EchoLeak (CVE-2025-32711) Microsoft 365 Copilotia vastaan: nollaklikkauksen hyökkäys sähköpostitse kiersi luokittelijat, linkkisuodattimet, sisältöturvakäytännön ja Retrieval-Augmented Generation -menetelmän. Meta ehdotti ”kahden sääntöä”: agentilla ei pitäisi olla samanaikaisesti pääsyä tietoihin, kykyä käsitellä epäluotettavaa syötettä ja mahdollisuutta muuttaa tilaa tai kommunikoida ulkomaailman kanssa. Dual-LLM-malli jakaa toiminnot kahdelle mallille: etuoikeutettu malli (työkaluilla) ei näe epäluotettavaa tekstiä, eristetty malli (tekstillä) ei omista työkaluja; ohjainkoodi välittää vain symbolisia muuttujia. Google DeepMind ehdotti CaMeL (Confidential Multi-Agent LLM) -järjestelmää, jossa on roolipohjaiseen pääsynhallintaan perustuva salaus: kullekin agentille on annettu vain tarvittavat roolit, ja epäluotettava tieto merkitään eivätkä etuoikeutetut agentit näe sitä. Vuonna 2025 julkaistiin kuusi suunnittelumallia, jotka systematisoivat eristämisen tehtävän mukaan. Toimiva toteutus kolmella toisiaan näkemättömällä mallilla deterministisine tarkistuksineen on purettu esimerkin avulla: FAQ-generaattori, joka lukee toisen sivun sisältöä, mutta ei tottele sitä.
Lähde: Habr — хаб ИИ — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset