Tekoälyturvallisuus RSS

Prompt-injektiota ei voi parantaa suodattimilla: Kuinka eristää epäluotettava teksti arkkitehtuuristen mallien avulla

Prompt-injektio on suurten kielimallien rakenteellinen vika, jossa epäluotettava teksti suoritetaan käskynä. Suodattimet ja järjestelmäkehotukset eivät ole tehokkaita: jopa parhaat puolustukset murretaan 90 prosentissa tapauksista adaptiivisissa hyökkäyksissä. Toimivat lähestymistavat – Dual-LLM, CaMeL ja Two Meta -sääntö – rakentavat eristystä sen sijaan, että yritettäisiin erottaa hyvä pahasta.

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
Habr — хаб ИИ24.07 · 11:01
Tuoreet uutiset