GuardRate : créer une arène indépendante pour les modèles de garde-fou (1re partie)
Meta
NVIDIA
OpenAI
AllenAI
Microsoft
L'équipe HiveTrace présente GuardRate, un outil et un classement pour évaluer objectivement les modèles de garde-fou. L'outil automatise le benchmarking, fournit des métriques transparentes telles que le taux de faux positifs (FPR) et le taux de faux négatifs (FNR), et met en évidence des insights comme l'architecture plutôt que la taille. Le classement est désormais public, et le code source de la CLI est prévu pour le troisième trimestre 2026.
L'équipe HiveTrace a créé GuardRate, un outil CLI et un classement public (HiveTrace GuardRate Leaderboard) pour comparer objectivement les modèles de garde-fou pour les LLM. L'outil automatise le pipeline d'évaluation : il extrait les ensembles de données et les configurations de modèles depuis YAML, lance des environnements isolés par modèle, exécute des benchmarks fixes et calcule des métriques (FPR, FNR, score intégral). Les résultats sont reproductibles via des artefacts. Le classement classe les modèles par score intégral ; les modèles en tête incluent YuFeng-XGuard-Reason-8B (0,761), HiveTraceGuard-Pro 0,6B (0,743) et OpenGuardrails-Text-2510 (0,738). Les enseignements montrent que l'architecture importe plus que la taille, que les petits modèles peuvent surpasser les plus grands, et que la latence varie considérablement (par exemple, Llama-3.1-Nemotron-Safety-Guard-8B a un p95 de 398,3 ms). Le processus a réduit le temps d'audit d'environ 5 heures à environ 30 minutes, réduisant le coût de la main-d'œuvre de 90 %. Le code source devrait être publié au troisième trimestre 2026.
Source: Habr — хаб ИИ —
original
