Modelos 🇷🇺 07.08.2026 13:01

GuardRate: Creando una Arena Independiente para Modelos de Guardarraíles (Parte 1)

MetaMeta NVIDIANVIDIA OpenAIOpenAI AllenAIAllenAI MicrosoftMicrosoft
El equipo de HiveTrace presenta GuardRate, una herramienta y tabla de clasificación para evaluar objetivamente modelos de guardarraíles. La herramienta automatiza la evaluación comparativa, proporcionando métricas transparentes como FPR y FNR, y destaca conocimientos como la arquitectura sobre el tamaño. La tabla de clasificación ahora es pública, y el código fuente de la CLI está previsto para el tercer trimestre de 2026.
El equipo de HiveTrace creó GuardRate, una herramienta CLI y un leaderboard público (HiveTrace GuardRate Leaderboard) para comparar objetivamente los modelos de guardarraíl para LLMs. La herramienta automatiza el pipeline de evaluación: extrae conjuntos de datos y configuraciones de modelos desde YAML, levanta entornos aislados por modelo, ejecuta benchmarks fijos y calcula métricas (FPR, FNR, Integral Score). Los resultados son reproducibles mediante artefactos. El leaderboard clasifica los modelos por Integral Score; los modelos líderes incluyen YuFeng-XGuard-Reason-8B (0.761), HiveTraceGuard-Pro 0.6B (0.743) y OpenGuardrails-Text-2510 (0.738). Los hallazgos muestran que la arquitectura importa más que el tamaño, que los modelos pequeños pueden superar a los más grandes y que la latencia varía ampliamente (por ejemplo, Llama-3.1-Nemotron-Safety-Guard-8B tiene p95=398.3 ms). El proceso redujo el tiempo de auditoría de aproximadamente 5 horas a unos 30 minutos, recortando el coste laboral en un 90%. El código fuente está previsto para su lanzamiento en el tercer trimestre de 2026.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas