모델AI 안전 🇺🇸 09.08.2026 23:01

Mistral AI, 오픈 가중치 멀티모달 안전 분류기 Shieldstral 1.0 3B 공개: 7배 크기 모델 능가

MistralMistral
Mistral AI가 정책 적응형 멀티모달 안전 분류기인 Shieldstral 1.0 3B를 출시했습니다. 이 모델은 고정된 유해 카테고리 분류 체계 대신 콘텐츠 모더레이션을 단일 예/아니오 질문으로 처리합니다. 텍스트 안전성에서 GPT-OSS-Safeguard-20B와 동등한 성능을 보이며, 멀티모달 안전성에서 앞섭니다.
Mistral AI가 개방형 가중치, 정책 적응형 멀티모달 안전 분류기인 Shieldstral 1.0 3B를 출시했습니다. 이 모델은 콘텐츠 조정을 고정된 유해성 범주 분류가 아닌 단일 예/아니오 질문으로 처리합니다. 유해성 범주를 가중치에 내장하는 대부분의 가드레일 모델과 달리, Shieldstral은 운영자가 추론 시 정책을 평이한 언어의 질문으로 작성할 수 있게 하며, 단일 순방향 패스로 보정된 안전 점수를 반환합니다. Ministral-3-3B-Base-2512를 기반으로 네이티브 Pixtral 비전 인코더를 갖추고 있으며 Apache 2.0 라이선스로 공개되었습니다. 텍스트 안전에서 평균 F1 점수 84.9%를 보고하여 GPT-OSS-Safeguard-20B와 동등한 수준이며, 멀티모달 안전에서는 83.8%로 Mistral이 평가한 모든 기준 모델을 앞섰습니다. 이 모델은 BF16에서 16GB의 VRAM에 들어맞고 단일 GPU에서 실행되며, vLLM, llama.cpp, SGLang, Transformers를 지원합니다. 학습 데이터에는 약 5,410만 개의 샘플이 포함되며, 대조적 생성(contrastive generation)을 통해 정책별 위반을 가르치는 어려운 네거티브 하드 네거티브를 만듭니다. 약점으로는 아랍어, 인도네시아어와 같은 저자원 언어에서의 성능 저하, 적대적이거나 난독화된 입력 및 매우 긴 문서에 대한 신뢰성 감소가 있습니다.
출처: MarkTechPost — 원문
관련 게시물 ↓
새로운 뉴스