Prompt-injektiota ei voi parantaa suodattimilla: Kuinka eristää epäluotettava teksti arkkitehtuuristen mallien avulla
Prompt-injektio on suurten kielimallien rakenteellinen vika, jossa epäluotettava teksti suoritetaan käskynä. Suodattimet ja järjestelmäkehotukset eivät ole tehokkaita: jopa parhaat puolustukset murretaan 90 prosentissa tapauksista adaptiivisissa hyökkäyksissä. Toimivat lähestymistavat – Dual-LLM, CaMeL ja Two Meta -sääntö – rakentavat eristystä sen sijaan, että yritettäisiin erottaa hyvä pahasta.
OpenAI
Anthropic
Google DeepMind
Microsoft
Habr — хаб ИИ24.07 · 11:01
