Тёмная сторона больших языковых моделей: как и почему их превращают в оружие (и что с этим делать)
Большие языковые модели (Large Language Models, LLM) уязвимы для атак типа «джейлбрейк», которые обходят их механизмы безопасности, позволяя им генерировать вредоносный контент, включая инструкции для совершения преступлений. Киберпреступники также используют специализированные «чёрные» LLM для совершения киберпреступлений. Среди мер защиты — многоуровневая фильтрация, состязательное обучение и сбор данных об атаках через краудсорсинговые проекты, такие как Gandalf.
Habr — хаб ИИ10.08 · 12:03
