Model 🇷🇺 07.08.2026 13:01

GuardRate: Membangun Arena Independen untuk Model Guardrail (Bagian 1)

MetaMeta NVIDIANVIDIA OpenAIOpenAI AllenAIAllenAI MicrosoftMicrosoft
Tim HiveTrace memperkenalkan GuardRate, sebuah alat dan papan peringkat untuk mengevaluasi model guardrail secara objektif. Alat ini mengotomatiskan benchmarking, menyediakan metrik transparan seperti FPR dan FNR, serta menyoroti wawasan seperti arsitektur di atas ukuran. Papan peringkat kini publik, dengan kode sumber CLI direncanakan untuk Q3 2026.
Tim HiveTrace menciptakan GuardRate, sebuah alat CLI dan papan peringkat publik (Papan Peringkat GuardRate HiveTrace) untuk membandingkan model pengaman untuk LLM secara objektif. Alat ini mengotomatiskan proses evaluasi: ia mengambil dataset dan konfigurasi model dari YAML, menjalankan lingkungan terisolasi untuk setiap model, menjalankan benchmark tetap, dan menghitung metrik (FPR, FNR, Skor Integral). Hasilnya dapat direproduksi melalui artefak. Papan peringkat memberi peringkat model berdasarkan Skor Integral; model terdepan termasuk YuFeng-XGuard-Reason-8B (0,761), HiveTraceGuard-Pro 0,6B (0,743), dan OpenGuardrails-Text-2510 (0,738). Wawasan menunjukkan bahwa arsitektur lebih penting daripada ukuran, model kecil dapat mengalahkan model yang lebih besar, dan latensi sangat bervariasi (misalnya, Llama-3.1-Nemotron-Safety-Guard-8B memiliki p95=398,3 ms). Proses ini mengurangi waktu audit dari sekitar 5 jam menjadi sekitar 30 menit, memangkas biaya tenaga kerja sebesar 90%. Kode sumber direncanakan akan dirilis pada Q3 2026.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru