Qwen3Guard: real-time streaming veiligheid voor tokens
Alibaba/Qwen
Alibaba Qwen heeft Qwen3Guard geïntroduceerd, het eerste veiligheidsmodel in de Qwen-familie, beschikbaar in twee varianten: Qwen3Guard-Gen voor offline analyse en Qwen3Guard-Stream voor real-time streaming moderatie. Het model ondersteunt 119 talen en een driedelige risicoclassificatie (Veilig, Onveilig, Controversieel).
Alibaba Qwen heeft Qwen3Guard uitgebracht, het eerste guardrailmodel in de Qwen-familie, bedoeld voor veiligheidsmoderatie in AI-systemen. Het model is gebaseerd op Qwen3 en biedt risicoclassificatie voor zowel prompts als antwoorden, met vermelding van het gevarenniveau en de categorie. Qwen3Guard is beschikbaar in twee varianten: Qwen3Guard-Gen (een generatief model voor offline annotatie en filtering van datasets) en Qwen3Guard-Stream (een gespecialiseerde versie voor realtime streaming detectie van veiligheid). Beide worden aangeboden in de maten 0,6 miljard, 4 miljard en 8 miljard parameters. Qwen3Guard-Stream maakt gebruik van twee lichte classificatieknoppen (heads) op de laatste transformatorlaag, waarmee de veiligheid per token kan worden beoordeeld tijdens het genereren van een antwoord. Er is een drietraps risicoschaal ingevoerd: Veilig (Safe), Onveilig (Unsafe) en Controversieel (Controversial) – de laatste maakt het mogelijk om de strengheid van het beleid flexibel aan te passen in verschillende scenario's. Het model behaalt state-of-the-art resultaten op veiligheidsbenchmarks voor Engels, Chinees en meertalige omgevingen en ondersteunt 119 talen. De broncode en gewichten zijn gepubliceerd op Hugging Face en ModelScope; ook is de cloudservice Alibaba Cloud AI Guardrails op basis van Qwen3Guard beschikbaar.
Bron: Alibaba Qwen —
origineel
