An toàn AI 🇺🇸 30.07.2026 14:03

Lỗ hổng cơ bản khiến các mô hình ngôn ngữ lớn (LLM) dễ bị tấn công

OpenAIOpenAI AnthropicAnthropic Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek
Các nhà nghiên cứu cho rằng các mô hình ngôn ngữ lớn (LLM) có một lỗ hổng cơ bản khiến chúng rất dễ bị tấn công. Bằng cách khai thác cách LLM xác định nguồn hướng dẫn, kẻ tấn công có thể lừa chúng tiết lộ thông tin bị cấm, chẳng hạn như cách tổng hợp ma túy hoặc hướng dẫn phá hoại máy bay.
Một bài báo được trình bày tại Hội nghị Quốc tế về Học máy bởi các nhà nghiên cứu độc lập Charles Ye và Jasmine Cui đã tiết lộ một lỗ hổng cơ bản trong các mô hình ngôn ngữ lớn khiến chúng dễ bị tấn công. Lỗ hổng này liên quan đến cách các mô hình ngôn ngữ lớn xác định ai hoặc cái gì đang đưa ra chỉ thị cho chúng, tạo điều kiện cho kẻ tấn công lừa chúng làm những việc không nên, chẳng hạn như cung cấp hướng dẫn tổng hợp cocaine hoặc phá hoại hệ thống định vị của máy bay. Các nhà nghiên cứu phát hiện ra rằng các mô hình ngôn ngữ lớn xác định vai trò của văn bản không dựa trên thẻ (tags) mà dựa trên phong cách, cho phép kẻ tấn công giả mạo vai trò. Họ đã chứng minh các cuộc tấn công giả mạo chuỗi suy luận (chain-of-thought forgery) lên các mô hình của OpenAI, Anthropic, Alibaba và DeepSeek. Các nhà nghiên cứu cho rằng vấn đề này về cơ bản là không thể giải quyết được, vì không có lượng huấn luyện nào có thể khắc phục hoàn toàn. Họ cảnh báo rằng các mô hình ngôn ngữ lớn đang được triển khai trong các hệ thống quan trọng mà thiếu các nghiên cứu cơ bản đầy đủ.
Nguồn: MIT Technology Review — bản gốc
Bài viết liên quan trước đây ↓
Tin mới