An toàn AI 🇷🇺 05.08.2026 16:02

Kiểm tra các mô hình ngôn ngữ lớn của Nga đối với OWASP LLM10: Các cuộc tấn công tiêu thụ không giới hạn

ЯндексЯндекс СберСбер
Các nhà nghiên cứu từ dự án AI Red Team đã kiểm tra các mô hình hàng đầu của Nga là YandexGPT Lite 5 và GigaChat Lite đối với các cuộc tấn công OWASP LLM10: Tiêu thụ không giới hạn. Họ đã sử dụng các lời nhắc được chế tác đặc biệt để kích hoạt mở rộng ngữ cảnh đệ quy, lồng ghép fractal, bùng nổ tổ hợp và mô phỏng đa tác tử, nhằm tăng tải tính toán. Nghiên cứu nhấn mạnh rằng các biện pháp phòng thủ truyền thống không đủ để chống lại các cuộc tấn công làm cạn kiệt tài nguyên như vậy.
Bài viết đề cập đến hạng mục OWASP LLM10: Unbounded Consumption (Tiêu thụ tài nguyên không giới hạn), tập trung vào các cuộc tấn công buộc mô hình ngôn ngữ lớn (Large Language Model - LLM) phải thực hiện một lượng tính toán lớn không tương xứng, dẫn đến cạn kiệt tài nguyên và từ chối dịch vụ. Các nhà nghiên cứu đã chuẩn bị các prompt độc hại đại diện cho nhiều lớp tấn công khác nhau, bao gồm mở rộng ngữ cảnh đệ quy (đệ quy kiểu Quine), lồng nhau dạng fractal, bùng nổ tính toán, bùng nổ tổ hợp ngữ nghĩa, mô phỏng đa tác tử (multi-agent), và lạm dụng glitch token. Những prompt này có thể khiến mô hình tạo ra các phản hồi dài quá mức, mô phỏng hàng nghìn thực thể, hoặc phân tích đệ quy chính suy luận của nó, tất cả đều được ngụy trang dưới dạng các yêu cầu hợp lệ từ người dùng. Nghiên cứu đã kiểm thử hai mô hình ngôn ngữ lớn hàng đầu của Nga là YandexGPT Lite 5 và GigaChat Lite, sử dụng dịch vụ web AI Red Team, hỗ trợ hơn 2000 prompt độc hại, trong đó 200 prompt nhằm vào OWASP LLM10. Việc đánh giá được thực hiện theo phương pháp LLM-as-judge (dùng LLM làm giám khảo) kết hợp với kiểm chứng thủ công. Bài viết nhấn mạnh rằng các biện pháp bảo mật truyền thống như lọc từ khóa là không hiệu quả, và chỉ ra nhu cầu cần có các biện pháp phòng thủ mang tính kiến trúc mạnh mẽ hơn.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới