Mô hìnhAn toàn AI 🇷🇺 15.08.2026 14:02

Làm thế nào để tránh làm hỏng LLM trong khi bảo vệ dữ liệu: Bên dưới nắp máy của bộ lọc Guardrails

OpenAIOpenAI AnthropicAnthropic
Bài viết này trình bày chi tiết những thách thức kỹ thuật trong việc xây dựng Guardrails Filter, một lớp bảo vệ dữ liệu cho các yêu cầu LLM. Bài viết nêu bật sự phức tạp của việc che giấu và bỏ che dữ liệu cá nhân trong các phản hồi phát trực tuyến, xử lý các lệnh gọi công cụ và hỗ trợ nhiều định dạng API. Tác giả chia sẻ những hiểu biết từ việc triển khai bộ lọc cho cả API Chat Completions và Messages.
Bài viết bàn về việc phát triển bộ lọc guardrails nhằm bảo vệ dữ liệu cá nhân trong các tương tác với các mô hình ngôn ngữ lớn. Mặc dù việc tìm kiếm dữ liệu cá nhân bằng biểu thức chính quy là khá đơn giản, nhưng thử thách thực sự nằm ở việc tích hợp bộ lọc giữa ứng dụng và mô hình mà không làm gián đoạn quá trình tương tác. Bộ lọc này phải xử lý các yêu cầu thông thường, chế độ phát trực tiếp, việc gọi công cụ, duy trì cấu trúc tin nhắn và bảo toàn siêu dữ liệu. Để xử lý nhiều trường hợp của cùng một loại dữ liệu, bộ lọc sử dụng bảng ánh xạ, gán các chỗ giữ chỗ duy nhất như <PHONE_1> cho từng giá trị riêng biệt. Do LLMs không lưu trạng thái, bộ lọc phải xử lý lại toàn bộ lịch sử hội thoại với mỗi yêu cầu. Trong chế độ phát trực tiếp, phản hồi được gửi về theo từng khối, và các chỗ giữ chỗ có thể bị chia rẽ giữa các khối; bộ lọc sử dụng bộ đệm để tích lũy đủ dữ liệu trước khi cố gắng khôi phục dữ liệu gốc. Nó cũng xử lý các trường khác nhau trong phản hồi, bao gồm nội dung, phần lập luận và đối số gọi công cụ, đảm bảo dữ liệu được khôi phục chính xác ở tất cả các trường đó. Phần triển khai chỉ dành cho chế độ phát trực tiếp trong Chat Completions đã lên tới khoảng 1.500 dòng mã. Bên cạnh đó, việc hỗ trợ Messages API đòi hỏi một phần triển khai riêng do định dạng dựa trên sự kiện, dẫn đến tổng số mã thử nghiệm vượt quá 4.000 dòng.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới