TekoälyturvallisuusMallit 🇷🇺 24.07.2026 11:01

Prompt Injection Ei Parane Suodattimilla: Miten Eristää Luottamaton Teksti Arkkitehtuuristen Mallien Avulla

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
Prompt injection -hyökkäys on edelleen rakenteellinen virhe LLM-sovelluksissa, eikä sitä korjata järjestelmäprompteilla tai luokittelijoilla. Arkkitehtuuriset mallit kuten Dual-LLM, Google DeepMindin CaMeL ja Metan Agents Rule of Two tarjoavat vankan eristyksen. Artikkeli kuvaa uhkamallin, EchoLeak-haavoittuvuuden Microsoft 365 Copilotissa sekä konkreettisen toteutuksen kolmella eristetyllä mallilla.
Prompt injection -tekniikan esitteli syyskuussa 2022 Simon Willison. Siinä LLM:n kontekstissa olevaa luottamattomia tekstiä suoritetaan ohjeistuksena. Toisin kuin jailbreaking, se vaikuttaa sovelluksiin, joissa mallilla on pääsy työkaluihin ja tietoihin, mikä johtaa confused deputy- ja tiedonpoistohyökkäyksiin. Artikkelin mukaan järjestelmäkehotteet ja suojakaide-luokittimet eivät ole tehokkaita, ja siinä viitataan OpenAI:n, Anthropicin ja Google DeepMindin vuoden 2025 tutkimukseen, joka osoitti, että adaptiiviset hyökkäykset ohittavat 12 julkaistua puolustusta yli 90 prosentin onnistumisprosentilla. Simon Willisonin 'tappava kolmikko' tunnistaa kolme tiedonpoiston edellytystä: pääsy yksityisiin tietoihin, kosketus luottamattomaan sisältöön ja ulkoinen kanava. EchoLeak-haavoittuvuus (CVE-2025-32711) Microsoft 365 Copilotissa hyödynsi kaikkia kolmea. Metan 'Agents Rule of Two' -sääntö toteaa, että agentilla saa olla enintään kaksi seuraavista kolmesta ominaisuudesta: luottamattoman syötteen käsittely, pääsy arkaluonteisiin järjestelmiin/tietoihin tai kyky muuttaa tilaa tai viestiä ulkoisesti. Arkkitehtuurit, kuten Dual-LLM (Willison, 2023), erottavat etuoikeutetun LLM:n (työkaluilla, näkee vain luotetun syötteen) karanteeniin sijoitetusta LLM:stä (ei työkaluja, käsittelee luottamatonta tekstiä), joita yhdistää deterministinen ohjain. Google DeepMindin CaMeL (2024) käyttää varmentajaa varmistamaan, että karanteenimalli tuottaa vain sallittujen tunnuksien tiukan alijoukon. Kuusi projektimallia vuoden 2025 artikkelista laajentaa tätä ajatusta. Konkreettinen toteutus kuvataan kolmella eristetyllä mallilla UKK-generaattoria varten: yksi etuoikeutettu, jolla on pääsy yrityksen tietoihin ja työkaluihin; yksi karanteeniin sijoitettu luottamatonta sivutekstiä varten; ja yksi synteesiä varten, deterministisillä tarkistuksilla niiden välillä.
Lähde: Habr — хаб ИИ — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset