GuardRate:ガードレールモデルのための独立アリーナを構築する(第1回)
Meta
NVIDIA
OpenAI
AllenAI
Microsoft
HiveTraceチームは、ガードレールモデルを客観的に評価するためのツール兼リーダーボードであるGuardRateを紹介します。このツールはベンチマークを自動化し、偽陽性率(FPR)や偽陰性率(FNR)などの透明な指標を提供するとともに、モデルのサイズよりもアーキテクチャが重要であるといった洞察を浮き彫りにします。リーダーボードは現在公開されており、CLIのソースコードは2026年第3四半期に公開予定です。
HiveTraceチームは、LLM向けガードレールモデルを客観的に比較するためのCLIツールと公開リーダーボード(HiveTrace GuardRate Leaderboard)を作成しました。このツールは評価パイプラインを自動化します。YAMLからデータセットとモデル設定を取得し、モデルごとに隔離された環境を起動し、固定されたベンチマークを実行し、メトリクス(FPR(偽陽性率)、FNR(偽陰性率)、Integral Score)を計算します。結果は成果物を介して再現可能です。リーダーボードはIntegral Scoreでモデルをランク付けしており、上位モデルにはYuFeng-XGuard-Reason-8B(0.761)、HiveTraceGuard-Pro 0.6B(0.743)、OpenGuardrails-Text-2510(0.738)が含まれます。洞察によると、アーキテクチャはサイズよりも重要であり、小さなモデルが大きなモデルを上回ることがあり、レイテンシは大きく異なります(例:Llama-3.1-Nemotron-Safety-Guard-8Bのp95は398.3ミリ秒)。このプロセスにより、監査時間は約5時間から約30分に短縮され、人件費は90%削減されました。ソースコードは2026年第3四半期に公開予定です。
出典: Habr — хаб ИИ —
原文
