An toàn AI 🇷🇺 29.07.2026 02:01

Prompt injection không phải là tấn công, mà là tính năng của trợ lý LLM

OpenAIOpenAI AnthropicAnthropic
Bài báo lập luận rằng prompt injection không phải là lỗ hổng bảo mật mà là hành vi bình thường của các trợ lý AI dựa trên Large Language Model (LLM, mô hình ngôn ngữ lớn) được thiết kế để làm theo hướng dẫn. Tác giả chứng minh qua thí nghiệm rằng nhiều dịch vụ AI coi văn bản trong tệp tải lên hoặc tác vụ dịch thuật là lệnh, và đề xuất các chiến lược giảm thiểu.
Tác giả giải thích rằng prompt injection đơn giản là một trợ lý AI tuân theo các hướng dẫn được nhúng trong dữ liệu do người dùng cung cấp, tương tự như một nhân viên siêng năng. Trong một thí nghiệm, 9 dịch vụ AI được đưa cho một tệp văn bản có hướng dẫn định dạng danh sách bằng chữ số La Mã và thêm một trích dẫn cố định vào tất cả các phản hồi trong tương lai. Hai dịch vụ hoàn toàn phớt lờ các hướng dẫn, năm dịch vụ định dạng danh sách nhưng không thay đổi cài đặt tài khoản, và hai dịch vụ thực hiện cả hai hướng dẫn. Tác giả lưu ý rằng ngay cả một nhiệm vụ dịch thuật cũng được 8 trong số 9 dịch vụ coi như một lệnh, với một dịch vụ cập nhật bộ nhớ tài khoản của nó. Vấn đề phát sinh vì các mô hình ngôn ngữ lớn (LLMs) không thể phân biệt giữa dữ liệu và hướng dẫn. Là một giải pháp một phần, tác giả đề xuất hướng dẫn rõ ràng cho AI coi tất cả đầu vào là dữ liệu, không phải lệnh, và lưu ý rằng ChatGPT và Claude đã có sẵn khả năng kháng cự prompt injection từ các tệp.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới