模型 🇷🇺 07.08.2026 13:01

GuardRate:构建护栏模型的独立竞技场(第一部分)

MetaMeta NVIDIANVIDIA OpenAIOpenAI AllenAIAllenAI MicrosoftMicrosoft
HiveTrace 团队推出 GuardRate,这是一个用于客观评估护栏模型的工具和排行榜。该工具自动化基准测试,提供如误报率(FPR)和漏报率(FNR)等透明指标,并强调架构优于规模等见解。排行榜现已公开,命令行界面(CLI)源代码计划于 2026 年第三季度发布。
HiveTrace团队创建了GuardRate,这是一个命令行工具和公开排行榜(HiveTrace GuardRate排行榜),旨在客观比较LLM的护栏模型。该工具自动化了评估流程:它从YAML中拉取数据集和模型配置,为每个模型启动隔离环境,运行固定基准,并计算指标(FPR、FNR、积分分数)。结果可通过工件复现。排行榜根据积分分数对模型进行排名;领先的模型包括YuFeng-XGuard-Reason-8B(0.761)、HiveTraceGuard-Pro 0.6B(0.743)和OpenGuardrails-Text-2510(0.738)。洞察表明,架构比规模更重要,小型模型可以击败大型模型,且延迟差异很大(例如,Llama-3.1-Nemotron-Safety-Guard-8B的p95=398.3毫秒)。该过程将审计时间从约5小时缩短至约30分钟,劳动力成本降低了90%。源代码计划于2026年第三季度发布。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻