Безопасность ИИ 🇺🇸 27.07.2026 02:04

Как я обратил ИИ к тёмной стороне: системные уязвимости в ведущих LLM

OpenAIOpenAI AnthropicAnthropic DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MetaMeta MicrosoftMicrosoft MistralMistral xAIxAI
Исследователь Дэйв Кушмар обнаружил множественные системные уязвимости в крупных больших языковых моделях (LLM), позволяющие обходить меры безопасности и получать опасные инструкции. Эксплойты работали почти во всех основных LLM, выявив общеотраслевую проблему безопасности. Кушмар призывает замедлить развертывание, повысить прозрачность и проводить масштабные исследования безопасности LLM.
Исследователь Дэйв Кушмар, бывший директор по кибербезопасности, обнаружил, что может обходить ограничения безопасности ведущих больших языковых моделей (Large Language Models, LLM), используя такие техники, как Time Bandit и Inception. Time Bandit использует отсутствие у LLM осведомленности о текущем времени, чтобы заставить ее работать в соответствии с устаревшими законами, а Inception
Показать ещё ↓
Источник: IEEE Spectrum AI — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости