Безопасность ИИ RSS

Поймай jailbreak, если сможешь: как путаница ролей обходит защиту LLM

Jailbreak больших языковых моделей (LLM) — это не взлом, а социальная инженерия: атакующий меняет контекст запроса так, чтобы запрещённый ответ казался нормальным. Исследователи из работы Prompt Injection as Role Confusion показали, что модель может путать служебные метки ролей (system, user, assistant) со стилем текста, и если стиль похож на «внутреннее рассуждение», атака CoT Forgery достигает 60% успешности.

OpenAIOpenAI AnthropicAnthropic
Habr — хаб ML24.07 · 05:03

AWS Continuum: новая платформа безопасности с агентами ИИ для предприятий

AWS представила Continuum — интегрированную платформу безопасности с четырьмя агентными функциями: пентест, проверка кода, моделирование угроз и обнаружение уязвимостей. Сервис автоматизирует полный цикл управления уязвимостями и уже доступен с пошаговой моделью ценообразования. Однако появление Continuum вызвало путаницу, так как он дублирует недавно выпущенный AWS Security Agent, который продолжает существовать отдельно.

Amazon Web ServicesAmazon Web Services
InfoQ 中国24.07 · 05:02
Свежие новости