Modelle 🇷🇺 07.08.2026 13:01

GuardRate: Aufbau einer unabhängigen Arena für Guardrail-Modelle (Teil 1)

MetaMeta NVIDIANVIDIA OpenAIOpenAI AllenAIAllenAI MicrosoftMicrosoft
Das HiveTrace-Team stellt GuardRate vor, ein Tool und eine Bestenliste zur objektiven Bewertung von Guardrail-Modellen. Das Tool automatisiert Benchmarking und liefert transparente Metriken wie FPR und FNR, wobei Erkenntnisse wie Architektur vor Größe hervorgehoben werden. Die Bestenliste ist jetzt öffentlich, der Quellcode der CLI ist für das dritte Quartal 2026 geplant.
Das HiveTrace-Team hat GuardRate entwickelt, ein CLI-Tool und eine öffentliche Bestenliste (HiveTrace GuardRate Leaderboard), um Guardrail-Modelle für LLMs objektiv zu vergleichen. Das Tool automatisiert die Evaluierungspipeline: Es zieht Datensätze und Modellkonfigurationen aus YAML, startet isolierte Umgebungen pro Modell, führt feste Benchmarks aus und berechnet Metriken (FPR, FNR, Integral Score). Ergebnisse sind über Artefakte reproduzierbar. Die Bestenliste ordnet Modelle nach Integral Score; führende Modelle sind YuFeng-XGuard-Reason-8B (0.761), HiveTraceGuard-Pro 0.6B (0.743) und OpenGuardrails-Text-2510 (0.738). Einblicke zeigen, dass Architektur wichtiger ist als Größe, kleine Modelle größere schlagen können und die Latenz stark variiert (z.B. hat Llama-3.1-Nemotron-Safety-Guard-8B p95=398.3 ms). Der Prozess reduzierte die Auditzeit von etwa 5 Stunden auf etwa 30 Minuten und senkte die Arbeitskosten um 90%. Der Quellcode soll im dritten Quartal 2026 veröffentlicht werden.
Quelle: Habr — хаб ИИ — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten