Tấn công LLM: Các nhà nghiên cứu có thể tái tạo lời nhắc của người dùng từ phản hồi của chatbot
Alibaba/Qwen
OpenAI
Các nhà nghiên cứu từ IIT Bombay và Adobe Research đã phát triển một phương pháp để tái tạo lời nhắc gốc của các mô hình ngôn ngữ lớn từ đầu ra văn bản của chúng với độ chính xác cao. Phương pháp này không yêu cầu truy cập vào trọng số mô hình và hoạt động ngay cả trên các mô hình từ các nhà cung cấp khác. Điều này đặt ra rủi ro bảo mật tiềm ẩn cho các doanh nghiệp sử dụng lời nhắc hệ thống độc quyền.
Các nhà nghiên cứu từ IIT Bombay và Adobe Research đã phát triển một phương pháp có thể tái dựng gần như chính xác các câu lệnh đầu vào (prompt) của các mô hình ngôn ngữ lớn (large language model - LLM) chỉ từ văn bản đầu ra của chúng. Phương pháp này hoạt động mà không cần truy cập vào trọng số của mô hình và thậm chí có thể chuyển giao sang các mô hình khác. Phương pháp mang tên 'Previous-Token Prediction' (PTP - Dự đoán token trước đó) đảo ngược nguyên lý cơ bản của các mô hình ngôn ngữ: thay vì dự đoán token tiếp theo, nó huấn luyện một mô hình nghịch đảo để dự đoán các token đứng trước. Mô hình nghịch đảo này được huấn luyện từ đầu, chỉ sử dụng dữ liệu tổng hợp do chính LLM mục tiêu tạo ra. Mô hình nghịch đảo không chỉ có thể khôi phục nguyên vẹn câu lệnh gốc mà còn tạo ra nhiều phương án câu lệnh thay thế khác nhau về ngữ nghĩa bằng cách thay đổi các tham số giải mã. Trong một ví dụ định tính từ bài báo, câu lệnh 'How to reach out to competitors to find their pricing strategies?' (Làm thế nào để tiếp cận đối thủ cạnh tranh nhằm tìm hiểu chiến lược định giá của họ?) đã được tái dựng chính xác, cùng với sáu biến thể khác. Các thử nghiệm với câu lệnh thực tế của ngường dùng cũng cho thấy những bản tái dựng trung thực về mặt ngữ nghĩa. Một mô hình nghịch đảo nhỏ được huấn luyện trên Qwen-3-0.6B-Chat thậm chí còn có thể tái dựng câu lệnh từ các phản hồi của GPT-4o, nắm bắt được bối cảnh và ý định tiềm ẩn — điều đó có nghĩa là kẻ tấn công thậm chí không cần biết mô hình nào đứng sau một văn bản đầu ra. Điều này đặt ra một vấn đề bảo mật rộng lớn đối với các doanh nghiệp, bởi các câu lệnh hệ thống độc quyền chứa bí mật kinh doanh, quy tắc kiểm duyệt hoặc các chỉ dẫn chuyên biệt đều có thể bị trích xuất, cùng với cả những dữ liệu đầu vào bảo mật của ngường dùng. Bản thân bài báo không đưa ra tuyên bố rõ ràng nào về việc tấn công các hệ thống thương mại, nhưng các nhà phát triển mô hình cần làm rõ và có khả năng phải khắc phục lỗ hổng này.
Nguồn: The Decoder (DE) —
bản gốc
