Một số mô hình AI tiên tiến dễ dàng bị vượt rào, báo cáo cho thấy
Anthropic
OpenAI
Google/DeepMind
Một báo cáo mới từ FAR.AI tiết lộ rằng một số mô hình AI hàng đầu có thể bị vượt rào với chi phí và công sức rất ít. Grok dễ bị tổn thương nhất, trong khi Claude và GPT vẫn miễn nhiễm với các cuộc tấn công đã thử nghiệm. Những phát hiện này nhấn mạnh nhu cầu về các quy định an toàn từ bên ngoài.
FAR.AI, một tổ chức phi lợi nhuận về an toàn AI, đã xây dựng một công cụ tạo ra hàng nghìn biến thể lời nhắc để phá vỡ hệ thống bảo vệ của các mô hình AI tiên tiến. Họ đã thử nghiệm trên các mô hình từ các công ty Mỹ: Claude Opus 4.8 và Fable 5 của Anthropic; GPT 5.5 và 5.6 của OpenAI; Gemini 3.1 Pro của Google; cùng Grok 4.3 và 4.5 từ SpaceXAI. Báo cáo phát hiện 448 vụ phá vỡ thành công cho Grok, 249 vụ cho Gemini, và không có vụ nào cho Claude, Fable hay GPT. Chi phí để phá vỡ Grok là 58 đô la và Gemini là 278 đô la. Giám đốc điều hành của FAR.AI, Adam Gleave, kêu gọi áp dụng các tiêu chuẩn an toàn bắt buộc, lưu ý rằng các cam kết tự nguyện là không đủ. Rohin Shah từ Google DeepMind cho rằng kết quả này không phải là một đánh giá an toàn toàn diện. Anthropic và Google nhấn mạnh vào những cải tiến liên tục. California, New York và Illinois đã thông qua luật yêu cầu báo cáo an toàn hoặc kiểm toán của bên thứ ba, nhưng chưa có yêu cầu cấp liên bang. Nhà Trắng đã yêu cầu trì hoãn việc phát hành một số mô hình. Các chuyên gia cảnh báo về nguy cơ lạm dụng trong lĩnh vực mạng, sinh học hoặc hóa học.
Nguồn: Wired AI —
bản gốc
