Mô hình AI dễ bị 'suy nghĩ quá mức' tạo ra lỗ hổng bảo mật
DeepSeek
Alibaba/Qwen
OpenAI
Google/DeepMind
Các nhà nghiên cứu từ Đại học Chiết Giang và Alibaba đã chứng minh một phương pháp cố tình gây ra 'suy nghĩ quá mức' trong các mô hình AI suy luận bằng cách đưa ra các prompt không nhất quán về mặt logic. Cuộc tấn công prompt tiến hóa này có thể khiến đầu ra dài hơn tới 26 lần, hoạt động như một cuộc tấn công từ chối dịch vụ lên các dịch vụ AI thương mại.
Các mô hình ngôn ngữ lớn (LLM) sử dụng suy luận từng bước dễ bị ảnh hưởng bởi hiện tượng gọi là 'suy nghĩ quá mức', khi chúng tạo ra các chuỗi suy luận dài một cách quá mức. Các nhà nghiên cứu từ Đại học Chiết Giang và Alibaba đã phát triển một thuật toán tiến hóa làm hỏng cấu trúc logic của các lời nhắc, khiến các mô hình rơi vào vòng lặp suy luận vô ích. Cuộc tấn công có hiệu quả đối với các mô hình từ DeepSeek (R1), Alibaba (Qwen3-Thinking), OpenAI (GPT-o3) và Google (Gemini 2.5 Flash), tạo ra đầu ra dài hơn tới 26,1 lần trên một điểm chuẩn toán học. Phương pháp này không yêu cầu truy cập nội bộ vào mô hình và có thể chuyển giao giữa các mô hình, làm tăng tính khả thi của nó. Tuy nhiên, các nhà nghiên cứu nhấn mạnh rằng mục tiêu của họ là làm nổi bật lỗ hổng, chứ không phải phát triển một cuộc tấn công thực tế, và hy vọng các nhà cung cấp sẽ phát triển các biện pháp giảm thiểu.
Nguồn: IEEE Spectrum AI —
bản gốc
