ModellenAI-veiligheid 🇷🇺 15.08.2026 14:02

Hoe LLM's niet te breken terwijl gegevens worden beschermd: onder de motorkap van Guardrails Filter

OpenAIOpenAI AnthropicAnthropic
Dit artikel beschrijft de technische uitdagingen bij het bouwen van een Guardrails Filter, een gegevensbeschermingslaag voor LLM-verzoeken. Het belicht de complexiteit van het maskeren en demaskeren van persoonsgegevens in streamingresponses, het afhandelen van toolcalls en het ondersteunen van meerdere API-formaten. De auteur deelt inzichten uit de implementatie van het filter voor zowel Chat Completions- als Messages-API's.
Het artikel bespreekt de ontwikkeling van een guardrails-filter dat is ontworpen om persoonlijke gegevens te beschermen bij interacties met grote taalmodellen. Hoewel het vinden van persoonlijke gegevens met behulp van reguliere expressies eenvoudig is, ligt de echte uitdaging in het integreren van het filter tussen de applicatie en het model zonder de interactie te verstoren. Het filter moet gewone verzoeken, streaming, tool-aanroepen afhandelen, de berichtstructuur behouden en metadata bewaren. Om meerdere exemplaren van hetzelfde gegevenstype te verwerken, gebruikt het filter een mappingtabel, waarbij unieke plaatshouders zoals <PHONE_1> aan elke afzonderlijke waarde worden toegewezen. Omdat grote taalmodellen stateloos zijn, moet het filter bij elk verzoek de volledige gespreksgeschiedenis opnieuw verwerken. In streamingmodus komen reacties in stukjes binnen, en plaatshouders kunnen over stukjes verdeeld zijn; het filter gebruikt een buffer om voldoende gegevens te verzamelen voordat het demasking probeert. Het verwerkt ook verschillende velden in reacties, waaronder inhoud, redenering en tool-aanroepparameters, en zorgt ervoor dat gegevens in al deze velden correct worden hersteld. De implementatie groeide tot ongeveer 1.500 regels code voor streaming in Chat Completions alleen. Bovendien vereiste de ondersteuning van de Messages API een aparte implementatie vanwege het op gebeurtenissen gebaseerde formaat, waardoor het totale aantal testregels op meer dan 4.000 kwam.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws