An toàn AIQuy định 🇷🇺 29.07.2026 07:02

Cách kiểm duyệt câu lệnh hoạt động trong các dịch vụ AI: tốt, xấu, bị chặn

OpenAIOpenAI AnthropicAnthropic xAIxAI Google/DeepMindGoogle/DeepMind ЯндексЯндекс
Việc kiểm duyệt các câu lệnh nhạy cảm trong dịch vụ AI bao gồm nhiều giai đoạn: chính sách sản phẩm, bộ phân loại đầu vào và bộ lọc đầu ra. Cùng một yêu cầu có thể được xử lý khác nhau bởi các mô hình khác nhau—một số chặn, một số cảnh báo, một số tuân thủ. Bài viết so sánh phản hồi từ GPT-5.5 Instant, Claude Sonnet 5 và Grok đối với một câu lệnh khiêu dâm ở ranh giới, đồng thời giải thích các kỹ thuật kiểm duyệt bao gồm ngưỡng bộ phân loại, bộ lọc dựa trên mô hình ngôn ngữ lớn (LLM) và tầm quan trọng của ngữ cảnh.
Việc kiểm duyệt nội dung trong các dịch vụ AI sử dụng hệ thống các chính sách sản phẩm, bộ phân loại đầu vào và bộ lọc đầu ra. Các mô hình khác nhau phản ứng khác nhau trước cùng một lời nhắc nhạy cảm: một mô hình có thể từ chối, mô hình khác có thể chỉ ra các chi tiết đáng ngờ, và mô hình thứ ba có thể tuân thủ. Bài báo đã thử nghiệm GPT-5.5 Instant (ChatGPT), Claude Sonnet 5 và Grok với một yêu cầu khiêu dâm ranh giới cho một cảnh truyện tranh. Chỉ có một mô hình đồng ý viết văn bản. Kiểm duyệt dựa trên các chính sách sản phẩm xác định các danh mục như đe dọa, thù hận, bạo lực, tự hại, nội dung tình dục, lạm dụng trẻ em và vũ khí. Bộ phân loại đầu vào gán điểm số cho từng danh mục—ví dụ, API Kiểm duyệt của OpenAI trả về 13 nhãn với các danh mục con. Bộ phân loại có thể tạo ra kết quả dương tính giả (chặn các truy vấn vô hại như 'cách giết chán') hoặc âm tính giả (bỏ sót nội dung có hại). Các công ty đặt ngưỡng cho từng danh mục: đối với tự hại, độ nhạy (recall) cao được ưu tiên; đối với các danh mục ít nguy hiểm hơn, độ chính xác (precision) có thể quan trọng hơn. Kiểm duyệt có thể được triển khai bằng một mô hình ngôn ngữ nhỏ (LLM, dựa trên lời nhắc) hoặc một bộ phân loại chuyên biệt. Các kiểm duyệt viên LLM linh hoạt nhưng tốn kém và dễ bị tấn công tiêm nhiễm lời nhắc; các bộ phân loại chuyên biệt nhanh hơn nhưng cứng nhắc. Thực hành tốt nhất bao gồm nhiều cấp độ xác minh, chuẩn bị một bộ kiểm thử với tiếng lóng và lỗi chính tả, cấu hình ngưỡng cho từng danh mục, xem xét các cuộc hội thoại dài, quản lý phiên bản cấu hình và ghi lại các quyết định để xem xét thủ công.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới