AI 안전모델 🇩🇪 06.08.2026 17:02

Mistral, 안전 분류를 위한 새로운 기법을 적용한 모델 출시

MistralMistral
Mistral AI가 AI 생성 콘텐츠를 조정하기 위한 유연한 질문-답변 방식을 사용하는 안전 모델 Shieldstral을 도입했습니다. 고정된 범주 대신 운영자가 조정 정책을 자연어 예/아니오 질문으로 정의하면, Shieldstral이 안전 점수를 반환합니다. 이 모델은 7배 더 큰 모델과 비슷한 성능을 16GB Nvidia GPU에서 달성합니다.
Mistral AI는 AI 생성 콘텐츠의 모더레이션을 간소화하도록 설계된 안전 모델인 Shieldstral을 발표했습니다. 이 모델은 고정된 범주 대신 유연한 질문-답변 방식을 사용합니다. 운영자는 "이 콘텐츠가 실제 폭력을 요구합니까?"와 같은 자연어 예/아니오 질문으로 자신의 모더레이션 정책을 공식화하며, Shieldstral은 안전 점수를 반환하여 프롬프트나 AI 응답을 승인하거나 거부할 수 있게 합니다. Mistral에 따르면 이 방법은 두 가지 장점이 있습니다. 첫째, 운영자는 언제든지 콘텐츠에 대해 묻는 질문을 쉽게 조정할 수 있습니다. 둘째, 콘텐츠의 맥락을 더 잘 평가할 수 있습니다. 예를 들어, 학교 수업에서 강제 수용소에 관한 강의 중 현대 연설의 필수적인 인용문이 개인 블로그 게시물의 콘텐츠로는 매우 비판적인 내용이 될 수 있습니다. 관련 논문의 저자들은 고정된 분류 체계를 가진 기존의 가드레일 모델은 허용 가능성이 종종 범주와 연결되어 있기 때문에 이러한 맥락적 차이를 적절히 포착할 수 없다고 주장합니다. 입력은 모더레이션을 이진 질문-답변 작업으로 취급합니다. 모델은 시스템 지시, 맥락, 예/아니오 질문을 받고, 추론 중에는 예와 아니오 로짓만 출력하고, 소프트맥스를 통해 정규화하여 연속적인 안전 점수를 생성합니다. Mistral은 Shieldstral이 7배 더 큰 모델과 동일한 성능을 달성하면서도 16GB Nvidia GPU에서 실행된다고 주장합니다. 기술적으로 Shieldstral은 Mistral 자체 제품군의 인과 언어 모델인 Ministral-3B-Base-2512를 기반으로 하며, 최근 수학적 증명과 형식 검증에 최적화된 Leanstral 1.5로 확장되었습니다. 이미지 처리를 위해 Pixtral-Vision-Encoder가 사용됩니다. 30억 매개변수 모델은 Apache-2.0 라이선스 하에 오픈 웨이트로 Hugging Face에서 다운로드할 수 있습니다.
출처: Heise online — 원문
관련 게시물 ↓
새로운 뉴스