ModelleKI-Sicherheit 🇷🇺 15.08.2026 14:02

Wie man LLMs nicht beschädigt und Daten schützt: Ein Blick unter die Haube des Guardrails-Filters

OpenAIOpenAI AnthropicAnthropic
Dieser Artikel beschreibt die technischen Herausforderungen beim Aufbau eines Guardrails-Filters, einer Datenschutzschicht für LLM-Anfragen. Er beleuchtet die Komplexität der Maskierung und Demaskierung personenbezogener Daten in Streaming-Antworten, die Verarbeitung von Tool-Aufrufen und die Unterstützung mehrerer API-Formate. Der Autor teilt Erkenntnisse aus der Implementierung des Filters für Chat-Completions- und Messages-APIs.
Der Artikel behandelt die Entwicklung eines Guardrails-Filters zum Schutz personenbezogener Daten bei der Interaktion mit großen Sprachmodellen. Während das Auffinden personenbezogener Daten mithilfe regulärer Ausdrücke unkompliziert ist, liegt die eigentliche Herausforderung darin, den Filter zwischen der Anwendung und dem Modell zu integrieren, ohne die Interaktion zu unterbrechen. Der Filter muss normale Anfragen, Streaming, Tool-Aufrufe verarbeiten, die Nachrichtenstruktur beibehalten und Metadaten bewahren. Um mehrere Vorkommen desselben Datentyps zu behandeln, verwendet der Filter eine Zuordnungstabelle, die jedem eindeutigen Wert Platzhalter wie <PHONE_1> zuweist. Da LLMs zustandslos sind, muss der Filter bei jeder Anfrage den gesamten Gesprächsverlauf erneut verarbeiten. Im Streaming-Modus kommen Antworten in Teilen an, und Platzhalter können über Teile hinweg aufgeteilt sein; der Filter verwendet einen Puffer, um genügend Daten anzusammeln, bevor er die Entmaskierung versucht. Er behandelt auch verschiedene Felder in Antworten, einschließlich Inhalt, Reasoning und Tool-Aufruf-Argumenten, und stellt sicher, dass Daten in allen korrekt wiederhergestellt werden. Die Implementierung wuchs auf etwa 1.500 Codezeilen für Streaming in Chat Completions allein an. Darüber hinaus erforderte die Unterstützung der Messages API eine separate Implementierung aufgrund ihres ereignisbasierten Formats, was den gesamten Testcode auf über 4.000 Zeilen brachte.
Quelle: Habr — хаб ИИ — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten