Mistral ra mắt mô hình mở để kiểm soát nội dung do AI tạo ra
Mistral
Mistral đã ra mắt Shieldstral, một mô hình bảo mật đa phương thức mã nguồn mở với 3 tỷ tham số, được thiết kế để phát hiện nội dung rủi ro và thực thi các chính sách quản trị. Mô hình chạy trên một GPU Nvidia duy nhất với 16 GB bộ nhớ và được phát hành theo giấy phép Apache 2.0. Các nhà phát triển có thể định nghĩa các quy tắc kiểm soát bằng các câu hỏi ngôn ngữ tự nhiên.
Trước sự gia tăng triển khai các trợ lý AI tạo sinh (generative AI) trong doanh nghiệp, việc kiểm soát nội dung đang trở thành một vấn đề trọng tâm. Để giải quyết vấn đề này, Mistral đã ra mắt Shieldstral, một mô hình bảo mật đa phương thức (multimodal) với 3 tỷ tham số, mã nguồn mở về trọng số, được thiết kế để nhận diện nội dung rủi ro và áp dụng các chính sách quản trị phù hợp. Mô hình này hỗ trợ 12 ngôn ngữ. Được công bố theo giấy phép Apache 2.0, mô hình cung cấp sẵn trọng số cho các nhà phát triển để dễ dàng tích hợp và điều chỉnh, và có thể chạy trên một GPU Nvidia duy nhất với 16 GB bộ nhớ video. Shieldstral có thể được tải xuống trên Hugging Face.
Khác với các hệ thống lọc truyền thống được huấn luyện dựa trên các danh mục định trước như bạo lực, phát ngôn thù ghét, lừa đảo hoặc nội dung khiêu dâm rõ ràng, Shieldstral sử dụng một cách tiếp cận có thể cấu hình, cho phép các nhà phát triển định nghĩa các quy tắc kiểm soát dưới dạng câu hỏi bằng ngôn ngữ tự nhiên, chẳng hạn như: "Nội dung này có kích động bạo lực thân thể không?" Yêu cầu này có thể được bổ sung bằng các hướng dẫn cụ thể về ngữ cảnh phân tích, mức độ nghiêm trọng dự kiến, hoặc bản chất của nội dung (văn bản hay hình ảnh). Mô hình đưa ra một đánh giá an toàn dạng nhị phân, chỉ tạo ra một token duy nhất cho quyết định cuối cùng, dựa trên xác suất của câu trả lời "có" và "không". Nó có thể được sử dụng ở nhiều giai đoạn khác nhau trong quy trình xử lý AI, chẳng hạn trước khi gửi yêu cầu của người dùng đến một mô hình tạo sinh, hoặc sau khi mô hình tạo ra phản hồi để kiểm tra trước khi công bố.
Theo Mistral, Shieldstral có hiệu suất tương đương hoặc vượt trội hơn so với các mô hình bảo vệ (guard model) mã nguồn mở có kích thước lớn hơn tới bảy lần, trên nhiều bài kiểm chuẩn (benchmark) khác nhau, đặc biệt là trong các lĩnh vực an toàn văn bản, phát hiện từ chối trả lời (refusal detection) và đánh giá đa phương thức, đạt điểm trung bình toàn cục 84,9% trong các bài đánh giá an toàn văn bản và 83,8% trong các bài kiểm tra an toàn đa phương thức bao gồm phân tích hình ảnh.
Nguồn: Le Monde Informatique — IA —
bản gốc
