GuardRate: Xây dựng đấu trường độc lập cho các mô hình bảo vệ (Phần 1)
Meta
NVIDIA
OpenAI
AllenAI
Microsoft
Nhóm HiveTrace giới thiệu GuardRate, một công cụ và bảng xếp hạng để đánh giá khách quan các mô hình bảo vệ. Công cụ này tự động hóa việc kiểm chuẩn, cung cấp các chỉ số minh bạch như FPR và FNR, đồng thời làm nổi bật các hiểu biết như kiến trúc quan trọng hơn kích thước. Bảng xếp hạng hiện đã công khai, với mã nguồn CLI dự kiến phát hành trong quý 3 năm 2026.
Nhóm HiveTrace đã tạo ra GuardRate, một công cụ dòng lệnh (CLI) và bảng xếp hạng công khai (HiveTrace GuardRate Leaderboard) để so sánh một cách khách quan các mô hình bảo vệ (guardrail models) cho các mô hình ngôn ngữ lớn (LLM). Công cụ này tự động hóa quy trình đánh giá: nó kéo các tập dữ liệu và cấu hình mô hình từ tệp YAML, khởi chạy các môi trường cô lập cho từng mô hình, chạy các bài kiểm tra chuẩn, và tính toán các chỉ số (FPR - tỷ lệ dương tính giả, FNR - tỷ lệ âm tính giả, Integral Score - điểm tích phân). Kết quả có thể tái tạo thông qua các tạo phẩm (artifacts). Bảng xếp hạng xếp hạng các mô hình theo Integral Score; các mô hình dẫn đầu bao gồm YuFeng-XGuard-Reason-8B (0.761), HiveTraceGuard-Pro 0.6B (0.743) và OpenGuardrails-Text-2510 (0.738). Những hiểu biết sâu sắc cho thấy kiến trúc quan trọng hơn kích thước, các mô hình nhỏ có thể đánh bại các mô hình lớn hơn, và độ trễ thay đổi rất lớn (ví dụ: Llama-3.1-Nemotron-Safety-Guard-8B có p95=398.3 ms). Quy trình này đã giảm thời gian kiểm tra từ khoảng 5 giờ xuống còn khoảng 30 phút, cắt giảm 90% chi phí nhân công. Mã nguồn dự kiến sẽ được phát hành trong quý 3 năm 2026.
Nguồn: Habr — хаб ИИ —
bản gốc
