Mistral veröffentlicht Modell mit neuer Technik für Sicherheitsklassifikationen
Mistral
Mistral AI hat Shieldstral vorgestellt, ein Sicherheitsmodell, das einen flexiblen Frage-Antwort-Ansatz zur Moderation von KI-generierten Inhalten verwendet. Anstelle fester Kategorien definieren Betreiber Moderationsrichtlinien als natürliche Ja-/Nein-Fragen, und Shieldstral liefert einen Sicherheits-Score. Das Modell erreicht eine Leistung, die mit der von siebenmal größeren Modellen vergleichbar ist, während es auf einer Nvidia-GPU mit 16 GB läuft.
Mistral AI hat Shieldstral vorgestellt, ein Sicherheitsmodell, das die Moderation von KI-generierten Inhalten vereinfachen soll. Es verwendet einen flexiblen Frage-Antwort-Ansatz anstelle fester Kategorien: Betreiber formulieren ihre Moderationsrichtlinien als natürlichsprachige Ja-/Nein-Fragen, wie zum Beispiel „Ruft dieser Inhalt zu realer Gewalt auf?“, und Shieldstral gibt einen Sicherheitswert zurück, auf dessen Grundlage die Anfrage oder KI-Antwort genehmigt oder abgelehnt werden kann. Laut Mistral hat diese Methode zwei Vorteile: Erstens können Betreiber die Fragen zu den Inhalten jederzeit einfach anpassen; zweitens kann der Kontext von Inhalten besser bewertet werden. Zum Beispiel könnten in einer Schulvorlesung über Konzentrationslager notwendige Originalzitate aus zeitgenössischen Reden äußerst kritisch als Inhalt für einen privaten Blogbeitrag sein. Die Autoren des zugehörigen Papers argumentieren, dass bisherige Guardrail-Modelle mit festen Taxonomien solche kontextuellen Unterschiede nicht angemessen erfassen können, da die Zulässigkeit oft an Kategorien gebunden ist. Der Input behandelt die Moderation als binäre Frage-Antwort-Aufgabe: Das Modell erhält eine Systemanweisung, Kontext und eine Ja-/Nein-Frage und gibt während der Inferenz nur die Logits für „Ja“ und „Nein“ aus, die über Softmax zu einem kontinuierlichen Sicherheitswert normalisiert werden. Mistral behauptet, dass Shieldstral die gleiche Leistung wie siebenmal größere Modelle erzielt, aber auf einer NVIDIA-GPU mit 16 Gigabyte läuft. Technisch basiert Shieldstral auf Ministral-3B-Base-2512, einem kausalen Sprachmodell aus Mistrals eigener Familie, das kürzlich um Leanstral 1.5 erweitert wurde, optimiert für mathematische Beweise und formale Verifikation. Für die Bildverarbeitung wird ein Pixtral-Vision-Encoder verwendet. Das 3-Milliarden-Parameter-Modell ist als Open Weights unter der Apache-2.0-Lizenz auf Hugging Face zum Download verfügbar.
Quelle: Heise online —
Original
