GuardRate: Bağımsız Bir Korkuluk Modeli Arenası Oluşturmak (Bölüm 1)
Meta
NVIDIA
OpenAI
AllenAI
Microsoft
HiveTrace ekibi, korkuluk modellerini nesnel olarak değerlendirmek için GuardRate adlı bir araç ve liderlik tablosu tanıtıyor. Araç, kıyaslamayı otomatikleştirir; FPR (yanlış pozitif oranı) ve FNR (yanlış negatif oranı) gibi şeffaf metrikler sağlar ve mimarinin boyuttan daha önemli olduğu gibi içgörüleri vurgular. Liderlik tablosu artık herkese açık olup, komut satırı arayüzü (CLI) kaynak kodunun 2026'nın üçüncü çeyreğinde yayınlanması planlanmaktadır.
HiveTrace ekibi, LLM'ler için guardrail modellerini objektif olarak karşılaştırmak amacıyla GuardRate adlı bir CLI aracı ve halka açık bir lider tablosu (HiveTrace GuardRate Lider Tablosu) oluşturdu. Araç, değerlendirme hattını otomatikleştirir: veri kümelerini ve model yapılandırmalarını YAML'dan çeker, her model için izole ortamlar başlatır, sabit kıyaslamaları çalıştırır ve metrikleri (FPR, FNR, İntegral Skoru) hesaplar. Sonuçlar yapılandırılmış veriler aracılığıyla tekrarlanabilir. Lider tablosu, modelleri İntegral Skoru'na göre sıralar; önde gelen modeller arasında YuFeng-XGuard-Reason-8B (0.761), HiveTraceGuard-Pro 0.6B (0.743) ve OpenGuardrails-Text-2510 (0.738) yer alır. İçgörüler, mimarinin boyuttan daha önemli olduğunu, küçük modellerin daha büyükleri yenebileceğini ve gecikme süresinin büyük ölçüde değiştiğini gösterir (örneğin, Llama-3.1-Nemotron-Safety-Guard-8B'nin p95 değeri 398.3 ms'dir). Bu süreç, denetim süresini yaklaşık 5 saatten yaklaşık 30 dakikaya düşürerek iş gücü maliyetini %90 azalttı. Kaynak kodunun 2026'nın üçüncü çeyreğinde yayınlanması planlanıyor.
Kaynak: Habr — хаб ИИ —
orijinal
