Modelos 🇷🇺 07.08.2026 13:01

GuardRate: Construindo uma Arena Independente para Modelos de Guardrail (Parte 1)

MetaMeta NVIDIANVIDIA OpenAIOpenAI AllenAIAllenAI MicrosoftMicrosoft
A equipe da HiveTrace apresenta o GuardRate, uma ferramenta e leaderboard para avaliar objetivamente modelos de guardrail. A ferramenta automatiza o benchmarking, fornecendo métricas transparentes como FPR e FNR, e destaca insights como arquitetura acima do tamanho. O leaderboard agora é público, com o código-fonte da CLI planejado para o terceiro trimestre de 2026.
A equipe HiveTrace criou o GuardRate, uma ferramenta CLI e um ranking público (HiveTrace GuardRate Leaderboard) para comparar objetivamente modelos de guardrail para LLMs. A ferramenta automatiza o pipeline de avaliação: ela extrai conjuntos de dados e configurações de modelos de arquivos YAML, cria ambientes isolados por modelo, executa benchmarks fixos e calcula métricas (FPR, FNR, Integral Score). Os resultados são reproduzíveis por meio de artefatos. O ranking classifica os modelos por Integral Score; os principais modelos incluem YuFeng-XGuard-Reason-8B (0.761), HiveTraceGuard-Pro 0.6B (0.743) e OpenGuardrails-Text-2510 (0.738). As percepções mostram que a arquitetura importa mais do que o tamanho, modelos pequenos podem superar os maiores, e a latência varia bastante (por exemplo, Llama-3.1-Nemotron-Safety-Guard-8B tem p95=398.3 ms). O processo reduziu o tempo de auditoria de cerca de 5 horas para cerca de 30 minutos, cortando o custo de mão de obra em 90%. O código-fonte está planejado para lançamento no terceiro trimestre de 2026.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas