モデル 🇷🇺 07.08.2026 13:01

GuardRate:ガードレールモデルのための独立アリーナを構築する(第1回)

MetaMeta NVIDIANVIDIA OpenAIOpenAI AllenAIAllenAI MicrosoftMicrosoft
HiveTraceチームは、ガードレールモデルを客観的に評価するためのツール兼リーダーボードであるGuardRateを紹介します。このツールはベンチマークを自動化し、偽陽性率(FPR)や偽陰性率(FNR)などの透明な指標を提供するとともに、モデルのサイズよりもアーキテクチャが重要であるといった洞察を浮き彫りにします。リーダーボードは現在公開されており、CLIのソースコードは2026年第3四半期に公開予定です。
HiveTraceチームは、LLM向けガードレールモデルを客観的に比較するためのCLIツールと公開リーダーボード(HiveTrace GuardRate Leaderboard)を作成しました。このツールは評価パイプラインを自動化します。YAMLからデータセットとモデル設定を取得し、モデルごとに隔離された環境を起動し、固定されたベンチマークを実行し、メトリクス(FPR(偽陽性率)、FNR(偽陰性率)、Integral Score)を計算します。結果は成果物を介して再現可能です。リーダーボードはIntegral Scoreでモデルをランク付けしており、上位モデルにはYuFeng-XGuard-Reason-8B(0.761)、HiveTraceGuard-Pro 0.6B(0.743)、OpenGuardrails-Text-2510(0.738)が含まれます。洞察によると、アーキテクチャはサイズよりも重要であり、小さなモデルが大きなモデルを上回ることがあり、レイテンシは大きく異なります(例:Llama-3.1-Nemotron-Safety-Guard-8Bのp95は398.3ミリ秒)。このプロセスにより、監査時間は約5時間から約30分に短縮され、人件費は90%削減されました。ソースコードは2026年第3四半期に公開予定です。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース