ModelKeamanan AI 🇷🇺 15.08.2026 14:02

Cara Menghindari Kerusakan LLM Sambil Melindungi Data: Di Balik Layar Filter Guardrails

OpenAIOpenAI AnthropicAnthropic
Artikel ini merinci tantangan rekayasa dalam membangun Filter Guardrails, lapisan perlindungan data untuk permintaan LLM. Ini menyoroti kompleksitas penyamaran dan pengungkapan data pribadi dalam respons streaming, menangani panggilan alat, dan mendukung berbagai format API. Penulis berbagi wawasan dari implementasi filter untuk API Chat Completions dan Messages.
Artikel ini membahas pengembangan filter guardrails yang dirancang untuk melindungi data pribadi dalam interaksi dengan model bahasa besar. Meskipun menemukan data pribadi menggunakan ekspresi reguler cukup mudah, tantangan sebenarnya terletak pada mengintegrasikan filter antara aplikasi dan model tanpa mengganggu interaksi. Filter harus menangani permintaan biasa, streaming, pemanggilan alat (tool calling), mempertahankan struktur pesan, dan melestarikan metadata. Untuk menangani beberapa instance dari tipe data yang sama, filter menggunakan tabel pemetaan, menetapkan placeholder unik seperti <PHONE_1> untuk setiap nilai yang berbeda. Karena LLM bersifat stateless (tanpa status), filter harus memproses ulang seluruh riwayat percakapan dengan setiap permintaan. Dalam mode streaming, respons tiba dalam potongan-potongan, dan placeholder dapat terbagi di antara potongan; filter menggunakan buffer untuk mengakumulasi data yang cukup sebelum melakukan demasking. Filter juga menangani berbagai bidang dalam respons, termasuk konten, penalaran, dan argumen pemanggilan alat, memastikan data dipulihkan dengan benar di semua bidang tersebut. Implementasi ini tumbuh menjadi sekitar 1.500 baris kode untuk streaming di Chat Completions saja. Selain itu, mendukung Messages API memerlukan implementasi terpisah karena formatnya yang berbasis peristiwa, sehingga total kode pengujian mencapai lebih dari 4.000 baris.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru