GuardRate: 가드레일 모델을 위한 독립적인 평가 플랫폼 구축 (1부)
Meta
NVIDIA
OpenAI
AllenAI
Microsoft
HiveTrace 팀은 가드레일 모델을 객관적으로 평가하기 위한 도구이자 리더보드인 GuardRate를 소개합니다. 이 도구는 벤치마킹을 자동화하여 FPR(위양성률)과 FNR(위음성률) 같은 투명한 지표를 제공하며, 모델 크기보다 아키텍처가 더 중요하다는 인사이트를 강조합니다. 리더보드는 현재 공개되었으며, CLI 소스 코드는 2026년 3분기에 공개될 예정입니다.
HiveTrace 팀은 LLM용 가드레일 모델을 객관적으로 비교하기 위해 CLI 도구이자 공개 리더보드인 GuardRate(HiveTrace GuardRate 리더보드)를 만들었습니다. 이 도구는 평가 파이프라인을 자동화합니다. 즉, YAML에서 데이터 세트와 모델 구성을 가져오고, 모델별로 격리된 환경을 구동하며, 고정된 벤치마크를 실행하고, 지표(FPR, FNR, Integral Score)를 계산합니다. 결과는 아티팩트를 통해 재현 가능합니다. 리더보드는 Integral Score로 모델을 순위 매기며, 상위 모델로는 YuFeng-XGuard-Reason-8B(0.761), HiveTraceGuard-Pro 0.6B(0.743), OpenGuardrails-Text-2510(0.738) 등이 있습니다. 인사이트에 따르면 아키텍처가 크기보다 중요하고, 작은 모델이 더 큰 모델을 이길 수 있으며, 지연 시간은 크게 다양합니다(예: Llama-3.1-Nemotron-Safety-Guard-8B의 p95는 398.3ms). 이 프로세스는 감사 시간을 약 5시간에서 30분으로 줄여 인건비를 90% 절감했습니다. 소스 코드는 2026년 3분기에 공개될 예정입니다.
출처: Habr — хаб ИИ —
원문
