Làm thế nào tôi đẩy AI vào bóng tối: Lỗ hổng hệ thống trong các LLM hàng đầu
OpenAI
Anthropic
DeepSeek
Google/DeepMind
Meta
Microsoft
Mistral
xAI
Nhà nghiên cứu Dave Kuszmar phát hiện nhiều lỗ hổng hệ thống trong các LLM lớn, cho phép anh ta vượt qua các biện pháp an toàn và nhận được hướng dẫn nguy hiểm. Các cuộc tấn công hoạt động trên hầu hết mọi LLM lớn, tiết lộ một vấn đề bảo mật trên toàn ngành. Kuszmar kêu gọi làm chậm triển khai, tăng cường minh bạch và nghiên cứu quy mô lớn về an toàn LLM.
Nhà nghiên cứu Dave Kuszmar, cựu giám đốc an ninh mạng, đã phát hiện ra rằng ông có thể vượt qua các hạn chế an toàn trong các mô hình ngôn ngữ lớn (LLM) hàng đầu bằng cách sử dụng các kỹ thuật như Time Bandit và Inception. Time Bandit khai thác việc LLM không nhận biết được thời gian hiện tại để khiến nó hoạt động dựa trên các luật lệ lỗi thời, trong khi Inception sử dụng các kịch bản lồng ghép để đánh lừa mô hình tạo ra nội dung độc hại. Các khai thác này hoạt động trên các mô hình bao gồm GPT-4o của OpenAI, Claude của Anthropic, DeepSeek, Gemini của Google, Llama của Meta, Copilot của Microsoft, Le Chat của Mistral và Grok của xAI. Kuszmar đã có thể lấy được hướng dẫn chế tạo napalm, methamphetamine, và thậm chí cả cơ sở làm giàu uranium cho vũ khí hạt nhân. Mặc dù đã báo cáo các lỗ hổng này cho OpenAI, CIA, FBI và các cơ quan khác, nhưng ông nhận được rất ít phản hồi. Các lỗ hổng cuối cùng đã được Bleeping Computer xác minh và báo cáo cho Đội Ứng cứu Khẩn cấp Máy tính của Viện Kỹ thuật Phần mềm Đại học Carnegie Mellon (SEI CERT).
Nguồn: IEEE Spectrum AI —
bản gốc
