Промпт-инъекция — это не атака, а особенность LLM-ассистентов
OpenAI
Anthropic
В статье утверждается, что промпт-инъекция — это не уязвимость безопасности, а нормальное поведение AI-ассистентов на основе больших языковых моделей (LLM), предназначенных для выполнения инструкций. Автор на примере эксперимента показывает, что многие AI-сервисы воспринимают текст в загруженных файлах или задачах перевода как команды, и предлагает стратегии смягчения.
Автор объясняет, что инжекция подсказок — это просто выполнение AI-ассистентом инструкций, встроенных в предоставленные пользователем данные, подобно старательному сотруднику. В эксперименте девяти AI-сервисам был дан текстовый файл с инструкцией: отформатировать список римскими цифрами и добавить постоянную цитату ко всем будущим ответам. Два сервиса полностью проигнорировали инструкции, пять
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
