Modellen 🇷🇺 07.08.2026 13:01

GuardRate: een Onafhankelijke Arena voor Guardrailmodellen Bouwen (Deel 1)

MetaMeta NVIDIANVIDIA OpenAIOpenAI AllenAIAllenAI MicrosoftMicrosoft
Het HiveTrace-team introduceert GuardRate, een tool en leaderboard voor het objectief evalueren van guardrailmodellen. De tool automatiseert benchmarking en biedt transparante metrieken zoals FPR en FNR, en benadrukt inzichten zoals architectuur boven omvang. Het leaderboard is nu openbaar, met de CLI-broncode gepland voor Q3 2026.
Het HiveTrace-team heeft GuardRate gecreëerd, een CLI-tool en openbaar leaderboard (HiveTrace GuardRate Leaderboard) om guardrail-modellen voor LLM's objectief te vergelijken. De tool automatiseert de evaluatiepijplijn: het haalt datasets en modelconfiguraties uit YAML, start geïsoleerde omgevingen per model op, voert vaste benchmarks uit en berekent metrieken (FPR, FNR, Integrale Score). Resultaten zijn reproduceerbaar via artefacten. Het leaderboard rangschikt modellen op basis van Integrale Score; toonaangevende modellen zijn onder andere YuFeng-XGuard-Reason-8B (0,761), HiveTraceGuard-Pro 0.6B (0,743) en OpenGuardrails-Text-2510 (0,738). Inzichten tonen aan dat architectuur belangrijker is dan grootte, kleine modellen grotere kunnen verslaan, en latentie sterk varieert (bijv. Llama-3.1-Nemotron-Safety-Guard-8B heeft p95=398,3 ms). Het proces verkortte de audittijd van ongeveer 5 uur tot ongeveer 30 minuten, waardoor de arbeidskosten met 90% daalden. De broncode staat gepland voor release in Q3 2026.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws