StruQ và SecAlign: Phòng thủ trước các cuộc tấn công tiêm nhiễm prompt
Meta
OpenAI
Các nhà nghiên cứu từ BAIR đề xuất hai phương pháp phòng thủ tinh chỉnh, StruQ và SecAlign, chống lại các cuộc tấn công tiêm nhiễm prompt trong các ứng dụng tích hợp LLM. StruQ sử dụng tinh chỉnh có cấu trúc để bỏ qua các hướng dẫn bị tiêm nhiễm, trong khi SecAlign áp dụng tối ưu hóa ưu tiên để đạt được độ mạnh mẽ tốt hơn, giảm tỷ lệ thành công của các cuộc tấn công xuống gần 0% đối với các cuộc tấn công không tối ưu hóa và dưới 15% đối với các cuộc tấn công dựa trên tối ưu hóa.
Tiêm prompt, nơi dữ liệu không đáng tin cậy chứa một chỉ thị ghi đè lên prompt dự định của hệ thống, được OWASP liệt kê là mối đe dọa số 1 đối với các ứng dụng tích hợp LLM. Các hệ thống cấp sản xuất như Google Docs, Slack AI và ChatGPT đã được chứng minh là dễ bị tổn thương. Các tác giả đề xuất hai nguyên nhân: thiếu sự tách biệt giữa prompt và dữ liệu, và các LLM được huấn luyện để tuân theo các chỉ thị ở bất kỳ đâu trong đầu vào. Để giải quyết những vấn đề này, họ giới thiệu một Front-End An toàn sử dụng các token đặc biệt để phân cách prompt và dữ liệu, lọc bỏ mọi dấu phân cách trong dữ liệu. StruQ (Điều chỉnh Chỉ thị có Cấu trúc) mô phỏng các cuộc tiêm prompt trong quá trình huấn luyện, dạy LLM bỏ qua các chỉ thị bị tiêm trong phần dữ liệu. SecAlign (Tối ưu hóa Sở thích Đặc biệt) tiến xa hơn bằng cách huấn luyện trên cả các phản hồi mong muốn và không mong muốn, sử dụng tối ưu hóa sở thích để tạo ra một khoảng cách xác suất lớn giữa chúng. Các thí nghiệm trên Llama3-8B-Instruct cho thấy StruQ giảm Tỷ lệ Thành công của Tấn công (ASR) xuống còn 45%, và SecAlign giảm thêm xuống còn 8% đối với các cuộc tấn công tinh vi. SecAlign giữ nguyên tính hữu ích như được đo bằng AlpacaEval2, trong khi StruQ giảm 4,5%. Cả hai đều giảm tỷ lệ thành công của các cuộc tấn công không tối ưu hóa xuống gần 0%, và SecAlign giảm ASR của các cuộc tấn công dựa trên tối ưu hóa xuống hơn 4 lần so với kết quả tốt nhất trước đây.
Nguồn: BAIR (Berkeley AI) —
bản gốc
