Lakera

최신 AI 뉴스, 모델 및 출시 정보 Lakera.

AI 안전 🇷🇺

LLM의 어두운 면: 어떻게, 왜 무기화되는가 (그리고 어떻게 대처할 것인가)

대규모 언어 모델(LLM)은 안전 메커니즘을 우회하는 제일브레이크 공격에 취약하며, 이를 통해 범죄 지침과 같은 유해한 콘텐츠를 생성할 수 있습니다. 위협 행위자들은 사이버 범죄를 위해 전용 블랙햇 LLM도 사용합니다. 방어책으로는 다층 필터링, 적대적 훈련, 그리고 Gandalf와 같은 프로젝트를 통한 크라우드소싱 공격 데이터 수집이 포함됩니다.

DeepSeekDeepSeek OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind MetaMeta LakeraLakera
Habr — хаб ИИ10.08 · 12:03
새로운 뉴스