Mistral AI veröffentlicht Shieldstral: ein politikadaptiver multimodaler Sicherheitsklassifikator
Mistral
Mistral AI hat Shieldstral vorgestellt, einen multimodalen Sicherheitsklassifikator mit offenen Gewichten und 3 Milliarden Parametern, der die Inhaltsmoderation als politikadaptive Frage-Antwort-Aufgabe betrachtet. Er übertrifft Modelle, die bis zu siebenmal so groß sind, akzeptiert zur Inferenzzeit Klartextrichtlinien und läuft auf einer einzigen NVIDIA-GPU mit 16 Gigabyte Speicher, alles unter der Apache-2.0-Lizenz.
Shieldstral ist ein multimodaler Sicherheitsklassifikator mit offenen Gewichten und 3 Milliarden Parametern, der von Mistral AI unter der Apache-2.0-Lizenz veröffentlicht wurde. Im Gegensatz zu herkömmlichen Guardrail-Modellen, die eine feste Taxonomie von Schadenskategorien in ihren Gewichten verankern, verfolgt Shieldstral einen neuartigen Ansatz: Nutzer schreiben die Sicherheitsrichtlinie zur Inferenzzeit als Frage in natürlicher Sprache, und das Modell gibt einen kalibrierten Sicherheitswert zurück. Diese Formulierung vereint Prompt-Klassifikation, Antwortmoderation, Verweigerungserkennung und Toxizitätserkennung in einem einzigen Problem und funktioniert ohne erneutes Training sowohl für Text als auch für Bilder. Das Modell erreicht oder übertrifft offene Guard-Modelle, die bis zu siebenmal größer sind, in den Bereichen Textsicherheit, Verweigerungserkennung, Richtlinienanpassungsfähigkeit und multimodalen Benchmarks. Es läuft effizient auf einer einzelnen NVIDIA-GPU mit 16 Gigabyte. Der Trainingsprozess umfasste die Vereinheitlichung heterogener öffentlicher Sicherheitsdatensätze, das Erlernen von Diskriminierung durch kontrastive Paare, die von einem großen Sprachmodell generiert wurden, die Verankerung von Sicherheit in Bildern durch Vision-Language-Reranking sowie die Kombination komplementärer Checkpoints mittels LoRA und SLERP. Mistral AI hat Shieldstral durchgängig auf seiner Forge-Plattform entwickelt. Das Unternehmen arbeitet weiterhin an mehrsprachiger Abdeckung, Robustheit bei längeren Dokumenten und umfassenderer multimodaler Sicherheit. Mistral AI ist außerdem Gründungsmitglied der Open Secure AI Alliance zusammen mit NVIDIA und anderen Organisationen.
Quelle: Mistral AI —
Original
