Prompt injection không phải là một cuộc tấn công, mà là một tính năng của trợ lý LLM
OpenAI
Anthropic
Bài báo cho rằng prompt injection không phải là lỗ hổng bảo mật mà là hành vi bình thường của các trợ lý AI dựa trên LLM được thiết kế để làm theo hướng dẫn. Tác giả chứng minh qua thí nghiệm rằng nhiều dịch vụ AI coi văn bản trong file tải lên hoặc nhiệm vụ dịch thuật là lệnh, và đề xuất các chiến lược giảm thiểu.
Tác giả giải thích rằng prompt injection đơn giản là một trợ lý AI tuân theo các hướng dẫn được nhúng trong dữ liệu do người dùng cung cấp, tương tự như một nhân viên siêng năng. Trong một thí nghiệm, 9 dịch vụ AI được đưa cho một tệp văn bản có hướng dẫn định dạng danh sách bằng chữ số La Mã và thêm một trích dẫn cố định vào tất cả các phản hồi trong tương lai. Hai dịch vụ hoàn toàn phớt lờ các hướng dẫn, năm dịch vụ định dạng danh sách nhưng không thay đổi cài đặt tài khoản, và hai dịch vụ thực hiện cả hai hướng dẫn. Tác giả lưu ý rằng ngay cả một nhiệm vụ dịch thuật cũng được 8 trong số 9 dịch vụ coi như một lệnh, với một dịch vụ cập nhật bộ nhớ tài khoản của nó. Vấn đề phát sinh vì các mô hình ngôn ngữ lớn (LLMs) không thể phân biệt giữa dữ liệu và hướng dẫn. Là một giải pháp một phần, tác giả đề xuất hướng dẫn rõ ràng cho AI coi tất cả đầu vào là dữ liệu, không phải lệnh, và lưu ý rằng ChatGPT và Claude đã có sẵn khả năng kháng cự prompt injection từ các tệp.
Nguồn: Habr — хаб ИИ —
bản gốc
