모델AI 안전 🇺🇸 04.08.2026 17:03

Mistral AI, 정책 적응형 멀티모달 안전 분류기 Shieldstral 공개

MistralMistral
Mistral AI가 콘텐츠 모더레이션을 정책 적응형 질의응답 작업으로 구성하는 30억 파라미터 규모의 오픈 가중치 멀티모달 안전 분류기 Shieldstral을 출시했습니다. 이 모델은 자체 크기의 최대 7배에 달하는 모델들을 능가하며, 추론 시 일반 언어로 된 정책을 입력받아 처리하고, 16GB NVIDIA GPU 단일 환경에서 실행되며, Apache 2.0 라이선스로 제공됩니다.
Shieldstral은 Mistral AI가 Apache 2.0 라이선스로 공개한 3B 규모의 오픈 가중치 멀티모달 안전 분류기입니다. 가중치에 고정된 유해 범주 분류 체계를 내장하는 기존의 가드레일 모델과 달리, Shieldstral은 새로운 접근 방식을 취합니다. 사용자가 추론 시점에 안전 정책을 평이한 언어로 된 질문으로 작성하면, 모델이 보정된 안전 점수를 반환합니다. 이러한 구성은 프롬프트 분류, 응답 검열, 거부 감지, 유해성 탐지를 하나의 문제로 통합하며, 재학습 없이 텍스트와 이미지 모두에 적용됩니다. 이 모델은 텍스트 안전, 거부 감지, 정책 적응성, 멀티모달 벤치마크에서 최대 7배 더 큰 오픈 가드 모델과 동등하거나 더 나은 성능을 보입니다. 또한 단일 16GB NVIDIA GPU에서 효율적으로 실행됩니다. 훈련 과정은 공개된 다양한 안전 데이터셋을 통합하고, LLM이 생성한 대조 쌍을 통해 판별을 학습하며, 비전-언어 재순위화로 이미지의 안전성을 근거 짓고, LoRA와 SLERP로 상호 보완적인 체크포인트를 결합하는 방식으로 진행되었습니다. Mistral AI는 자사의 Forge 플랫폼에서 Shieldstral을 처음부터 끝까지 구축했습니다. 회사는 다국어 지원, 장문 문서 강건성, 더 넓은 멀티모달 안전을 위한 작업을 계속하고 있습니다. Mistral AI는 또한 NVIDIA 및 다른 기관들과 함께 Open Secure AI Alliance의 창립 멤버입니다.
출처: Mistral AI — 원문
관련 게시물 ↓
새로운 뉴스