Безопасность ИИ RSS

Prompt injection не лечится фильтрами: как изолировать недоверенный текст с помощью архитектурных паттернов

Prompt injection — структурный дефект LLM, при котором недоверенный текст исполняется как инструкция. Фильтры и системные промпты неэффективны: даже лучшие защиты пробиваются в 90% случаев при адаптивных атаках. Рабочие подходы — Dual-LLM, CaMeL и правило двух Meta — строят изоляцию, а не пытаются отличить добро от зла.

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
Habr — хаб ИИ24.07 · 11:01

Безопасность и согласование в эпоху долгосрочных моделей

OpenAI делится опытом развёртывания длительно работающих ИИ-моделей, отмечая новые риски безопасности, наблюдаемые сбои и улучшенные меры защиты благодаря итеративному развёртыванию.

OpenAIOpenAI
OpenAI24.07 · 08:05
Свежие новости