Mallit 🇷🇺 07.08.2026 13:01

GuardRate: Rakentamassa riippumatonta areenaa suojakäytävä-malleille (Osa 1)

MetaMeta NVIDIANVIDIA OpenAIOpenAI AllenAIAllenAI MicrosoftMicrosoft
HiveTrace-tiimi esittelee GuardRate-työkalun ja johtotaulukon suojakäytävä-mallien objektiiviseen arviointiin. Työkalu automatisoi vertailutestauksen ja tarjoaa läpinäkyviä mittareita, kuten FPR ja FNR, sekä nostaa esiin oivalluksia, kuten arkkitehtuurin merkityksen koon sijaan. Johtotaulukko on nyt julkinen, ja CLI-lähdekoodin julkaisu on suunniteltu vuoden 2026 kolmannelle neljännekselle.
HiveTrace-tiimi loi GuardRate-nimisen CLI-työkalun ja julkisen johtotaulukon (HiveTrace GuardRate Leaderboard) vertaillakseen objektiivisesti suojakaiteita (guardrail) LLM-malleille. Työkalu automatisoi arviointiputken: se hakee tietoaineistot ja mallikokoonpanot YAML:stä, käynnistää eristetyt ympäristöt kullekin mallille, suorittaa kiinteät vertailuajot ja laskee mittarit (FPR, FNR, Integral Score). Tulokset ovat toistettavissa artefaktien avulla. Johtotaulukko järjestää mallit Integral Scoren mukaan; johtavia malleja ovat YuFeng-XGuard-Reason-8B (0,761), HiveTraceGuard-Pro 0,6B (0,743) ja OpenGuardrails-Text-2510 (0,738). Havainnot osoittavat, että arkkitehtuuri on merkittävämpi kuin koko, pienet mallit voivat voittaa suurempia, ja latenssi vaihtelee suuresti (esim. Llama-3.1-Nemotron-Safety-Guard-8B:n p95 = 398,3 ms). Prosessi lyhensi auditointiajan noin viidestä tunnista noin 30 minuuttiin, mikä vähensi työvoimakustannuksia 90 prosenttia. Lähdekoodin julkaisu on suunniteltu vuoden 2026 kolmannelle neljännekselle.
Lähde: Habr — хаб ИИ — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset