LLM의 어두운 면: 어떻게, 왜 무기화되는가 (그리고 어떻게 대처할 것인가)
대규모 언어 모델(LLM)은 안전 메커니즘을 우회하는 제일브레이크 공격에 취약하며, 이를 통해 범죄 지침과 같은 유해한 콘텐츠를 생성할 수 있습니다. 위협 행위자들은 사이버 범죄를 위해 전용 블랙햇 LLM도 사용합니다. 방어책으로는 다층 필터링, 적대적 훈련, 그리고 Gandalf와 같은 프로젝트를 통한 크라우드소싱 공격 데이터 수집이 포함됩니다.
DeepSeek
OpenAI
Anthropic
Google/DeepMind
Meta
Lakera
Habr — хаб ИИ10.08 · 12:03
