An toàn AIMô hình 🇷🇺 24.07.2026 11:01

Prompt Injection Không Thể Chữa Bằng Bộ Lọc: Cách Cô Lập Văn Bản Không Đáng Tin Cậy Bằng Các Mẫu Kiến Trúc

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
Prompt injection vẫn là một lỗ hổng cấu trúc trong các ứng dụng LLM, không thể khắc phục bằng system prompt hay bộ phân loại. Các mẫu kiến trúc như Dual-LLM, CaMeL từ Google DeepMind và Agents Rule of Two từ Meta cung cấp khả năng cô lập mạnh mẽ. Bài viết trình bày chi tiết mô hình đe dọa, lỗ hổng EchoLeak trong Microsoft 365 Copilot và một triển khai cụ thể với ba mô hình cô lập.
Prompt injection, do Simon Willison giới thiệu vào tháng 9 năm 2022, xảy ra khi văn bản không đáng tin cậy trong ngữ cảnh của LLM được thực thi như một chỉ dẫn. Không giống như jailbreak, nó ảnh hưởng đến các ứng dụng nơi mô hình có quyền truy cập vào các công cụ và dữ liệu, dẫn đến các cuộc tấn công confused deputy và đánh cắp dữ liệu. Bài báo lập luận rằng các lời nhắc hệ thống và bộ phân loại rào chắn không hiệu quả, trích dẫn một nghiên cứu năm 2025 của OpenAI, Anthropic và Google DeepMind cho thấy các cuộc tấn công thích ứng vượt qua 12 biện pháp phòng thủ đã công bố với tỷ lệ thành công hơn 90%. 'Bộ ba chết người' của Simon Willison xác định ba yếu tố dẫn đến đánh cắp dữ liệu: quyền truy cập dữ liệu riêng tư, tiếp xúc với nội dung không đáng tin cậy và kênh đầu ra. Lỗ hổng EchoLeak (CVE-2025-32711) trong Microsoft 365 Copilot đã khai thác cả ba yếu tố này. 'Quy tắc hai trong ba của Agent' của Meta phát biểu rằng một tác nhân không nên có quá hai trong ba thuộc tính: xử lý đầu vào không đáng tin cậy, truy cập hệ thống/dữ liệu nhạy cảm và khả năng thay đổi trạng thái hoặc giao tiếp ra bên ngoài. Các kiến trúc như Dual-LLM (Willison, 2023) tách biệt LLM đặc quyền (có công cụ, chỉ thấy đầu vào đáng tin cậy) khỏi LLM cách ly (không có công cụ, xử lý văn bản không đáng tin cậy), kết nối bằng một bộ điều khiển xác định. Google DeepMind's CaMeL (2024) sử dụng một bộ xác minh để buộc mô hình cách ly chỉ xuất ra một tập con nghiêm ngặt các token được phép. Sáu mẫu dự án từ một bài báo năm 2025 mở rộng ý tưởng này. Một triển khai cụ thể được mô tả sử dụng ba mô hình cô lập cho một trình tạo FAQ: một mô hình đặc quyền có quyền truy cập dữ liệu và công cụ của công ty, một mô hình cách ly cho văn bản trang không đáng tin cậy, và một mô hình tổng hợp, với các kiểm tra xác định giữa chúng.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới