Mistral, AI 생성 콘텐츠 제어를 위한 오픈 모델 공개
Mistral
Mistral이 위험한 콘텐츠를 감지하고 거버넌스 정책을 시행하도록 설계된 30억 파라미터의 오픈 가중치 멀티모달 보안 모델인 Shieldstral을 출시했습니다. 이 모델은 16GB 메모리의 단일 Nvidia GPU에서 실행되며 Apache 2.0 라이선스로 공개되었습니다. 개발자는 자연어 질문을 사용하여 제어 규칙을 정의할 수 있습니다.
기업 환경에서 생성형 AI 어시스턴트의 도입이 확대되면서 콘텐츠 통제가 핵심 과제로 떠오르고 있다. 이에 대응하기 위해 Mistral은 위험한 콘텐츠를 식별하고 적절한 거버넌스 정책을 적용하도록 설계된 30억 파라미터 규모의 오픈 웨이트 멀티모달 보안 모델 Shieldstral을 출시했다. 이 모델은 12개 언어를 지원한다. Apache 2.0 라이선스로 공개된 이 모델은 개발자가 손쉽게 통합하고 조정할 수 있도록 가중치를 제공하며, 16GB 비디오 메모리를 갖춘 단일 Nvidia GPU에서도 구동할 수 있다. Shieldstral은 Hugging Face를 통해 다운로드할 수 있다.
폭력, 혐오 발언, 사기, 노골적인 성적 콘텐츠와 같이 미리 정의된 범주로 학습된 기존의 필터링 시스템과 달리, Shieldstral은 개발자가 자연어 질문 형태로 통제 규칙을 정의할 수 있는 구성 가능한 방식을 채택했다. 예를 들어 '이 콘텐츠가 신체적 폭력을 조장하는가?'와 같은 질문을 규칙으로 설정할 수 있다. 이러한 요청에는 분석 맥락, 예상되는 심각도, 콘텐츠의 성격(텍스트 또는 이미지)을 명시하는 지침을 추가로 덧붙일 수 있다. 이 모델은 이진(binary) 형태의 안전성 평가를 제공하며, '예'와 '아니오' 답변의 확률을 기반으로 최종 판단을 위한 단 하나의 토큰만을 생성한다. Shieldstral은 AI 처리 과정의 여러 단계에서 활용할 수 있는데, 사용자 요청을 생성형 모델에 전달하기 전 단계에서 사용할 수도 있고, 생성 이후 응답을 게시하기 전에 검증하는 단계에서 사용할 수도 있다.
Mistral에 따르면 Shieldstral은 여러 벤치마크에서 자사보다 최대 7배 큰 규모의 오픈 가드 모델과 동등하거나 그 이상의 성능을 보였으며, 특히 텍스트 안전성 평가, 거부(응답 차단) 탐지, 멀티모달 평가 부문에서 두드러진 성과를 냈다. 텍스트 안전성 평가에서는 평균 종합 점수 84.9%, 이미지 분석을 포함한 멀티모달 안전성 테스트에서는 83.8%를 기록했다.
출처: Le Monde Informatique — IA —
원문
