Как я обратил ИИ к тёмной стороне: системные уязвимости в ведущих LLM
OpenAI
Anthropic
DeepSeek
Google/DeepMind
Meta
Microsoft
Mistral
xAI
Исследователь Дэйв Кушмар обнаружил множественные системные уязвимости в крупных больших языковых моделях (LLM), позволяющие обходить меры безопасности и получать опасные инструкции. Эксплойты работали почти во всех основных LLM, выявив общеотраслевую проблему безопасности. Кушмар призывает замедлить развертывание, повысить прозрачность и проводить масштабные исследования безопасности LLM.
Исследователь Дэйв Кушмар, бывший директор по кибербезопасности, обнаружил, что может обходить ограничения безопасности ведущих больших языковых моделей (Large Language Models, LLM), используя такие техники, как Time Bandit и Inception. Time Bandit использует отсутствие у LLM осведомленности о текущем времени, чтобы заставить ее работать в соответствии с устаревшими законами, а Inception
Показать ещё ↓
Источник: IEEE Spectrum AI —
оригинал
