AI 서비스에서 프롬프트 조정이 작동하는 방식: 좋음, 나쁨, 차단됨
OpenAI
Anthropic
xAI
Google/DeepMind
Яндекс
AI 서비스에서 민감한 프롬프트의 조정은 제품 정책, 입력 분류기, 출력 필터 등 여러 단계를 거칩니다. 동일한 요청도 모델에 따라 다르게 처리됩니다. 일부는 차단하고, 일부는 경고하며, 일부는 따릅니다. 이 기사는 경계선상의 에로틱 프롬프트에 대한 GPT-5.5 Instant, Claude Sonnet 5, Grok의 응답을 비교하고, 분류기 임계값, LLM 기반 필터, 컨텍스트의 중요성 등 조정 기술을 설명합니다.
AI 서비스의 콘텐츠 조정은 제품 정책, 입력 분류기, 출력 필터 시스템을 사용합니다. 동일한 민감한 프롬프트에 대해 서로 다른 모델은 다르게 반응합니다. 예를 들어, 거절하거나, 의심스러운 세부 사항을 지적하거나, 요청을 이행할 수 있습니다. 이 기사에서는 만화 장면에 대한 경계선상의 에로틱한 요청으로 GPT-5.5 Instant, Claude Sonnet 5, Grok을 테스트했습니다. 단 하나의 모델만이 텍스트 작성을 동의했습니다. 조정은 위협, 증오, 폭력, 자해, 성적 콘텐츠, 아동 학대, 무기 등의 범주를 정의하는 제품 정책에 의존합니다. 입력 분류기는 각 범주에 점수를 할당합니다. 예를 들어, OpenAI의 Moderation API는 하위 범주가 포함된 13개의 레이블을 반환합니다. 분류기는 '지루함을 죽이는 방법'과 같은 무해한 질문을 차단하는 거짓 양성 또는 유해 콘텐츠를 놓치는 거짓 음성을 생성할 수 있습니다. 기업은 범주별로 임계값을 설정합니다. 자해의 경우 재현율이 높게 우선시되고, 덜 위험한 범주의 경우 정밀도가 더 중요할 수 있습니다. 조정은 소형 LLM(프롬프트 기반) 또는 전문화된 분류기로 구현될 수 있습니다. LLM 조정기는 유연하지만 비용이 많이 들고 프롬프트 주입에 취약한 반면, 전문화된 분류기는 빠르지만 경직됩니다. 모범 사례에는 여러 검증 수준, 속어와 오타가 포함된 테스트 세트 준비, 범주별 임계값 구성, 긴 대화 검토, 구성 버전 관리, 수동 검토를 위한 결정 로깅이 포함됩니다.
출처: Habr — хаб ИИ —
원문
