An toàn AINghiên cứu 🇺🇸 27.07.2026 02:04

GPT-Red: Hệ thống Red Teaming Tự động của OpenAI nhằm Cải thiện An toàn AI

OpenAIOpenAI
OpenAI đã giới thiệu GPT-Red, một hệ thống red teaming tự động sử dụng phương pháp tự chơi để nâng cao tính an toàn, khả năng căn chỉnh, và độ bền vững trước tấn công prompt injection của các mô hình ngôn ngữ lớn. Hệ thống cho phép mô hình tự động sinh ra các kịch bản tấn công và tinh chỉnh dựa trên chúng, cải thiện độ bền vững mà không cần sự can thiệp liên tục của con người.
OpenAI đã công bố GPT-Red, một hệ thống kiểm tra đỏ tự động được thiết kế để tăng cường an toàn, sự phù hợp và độ mạnh mẽ của trí tuệ nhân tạo. Hệ thống này sử dụng phương pháp học tự đối kháng, trong đó mô hình tự động tạo ra các cuộc tấn công và kịch bản độc hại, sau đó tự tinh chỉnh trên chúng để cải thiện khả năng phòng thủ. Cách tiếp cận này cho phép liên tục nâng cao độ mạnh mẽ của mô hình mà không cần thường xuyên có người kiểm tra. GPT-Red đặc biệt hiệu quả trong việc phát hiện và giảm thiểu các lỗ hổng do tiêm nhiễm lời nhắc, nơi kẻ tấn công cố gắng vượt qua các hạn chế của mô hình bằng các truy vấn được tạo ra một cách tinh vi. Hệ thống tự động đánh giá kết quả của các cuộc tấn công và sử dụng chúng để điều chỉnh hành vi của mô hình, giúp quá trình cải thiện bảo mật trở nên có khả năng mở rộng và hiệu quả hơn.
Nguồn: OpenAI — bản gốc
Bài viết liên quan trước đây ↓
Tin mới