Безопасность ИИ 🇷🇺 10.08.2026 12:03

Тёмная сторона больших языковых моделей: как и почему их превращают в оружие (и что с этим делать)

DeepSeek OpenAI Anthropic Google/DeepMind Meta Lakera
Большие языковые модели (Large Language Models, LLM) уязвимы для атак типа «джейлбрейк», которые обходят их механизмы безопасности, позволяя им генерировать вредоносный контент, включая инструкции для совершения преступлений. Киберпреступники также используют специализированные «чёрные» LLM для совершения киберпреступлений. Среди мер защиты — многоуровневая фильтрация, состязательное обучение и сбор данных об атаках через краудсорсинговые проекты, такие как Gandalf.
Джейлбрейк — это разновидность инъекции в промпт, при которой злоумышленник назначает LLM роль, отменяющую её обучение безопасности. Например, промпт под названием SWILL был опубликован на форумах, заставив DeepSeek поверить, что это другая модель без цензуры, после чего он охотно давал советы по уничтожению отпечатков пальцев и изготовлению фальшивых денег, хотя по-прежнему отказывался обсуждать
Показать ещё ↓
Источник: Habr — хаб ИИ — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости