An toàn AIỨng dụng 🇷🇺 29.07.2026 16:01

Cách ngăn chặn tâm lý gia AI khỏi xu nịnh và ảo giác: phân tích kỹ thuật về các biện pháp bảo vệ an toàn

Character.AICharacter.AI
Bài viết xem xét lý do tại sao các mô hình ngôn ngữ lớn đa năng lại nguy hiểm khi đảm nhận vai trò sức khỏe tâm thần do xu nịnh, ảo giác và mù khủng hoảng. Nó phân tích các lớp bảo vệ an toàn (như tuyên bố miễn trừ, quy trình xử lý khủng hoảng, thang đo đã được xác thực) và nêu bật kiến trúc đa tác tử (ví dụ: Vera) nơi một tác tử giám sát AI thứ hai và người đánh giá học thuật kiểm tra mọi phản hồi. Sự đánh đổi là chi phí và độ trễ cao hơn cho việc đánh giá cấp nội dung, và tác giả đặt câu hỏi nên cân bằng giữa an toàn và chi phí ở đâu.
Bài báo cho rằng các LLM đa năng không phù hợp với liệu pháp tâm lý vì ba khiếm khuyết cố hữu: xu nịnh (các mô hình được huấn luyện với RLHF có xu hướng đồng ý với người dùng), ảo giác (tự tin tạo ra các thông tin sai lệch) và giám sát khủng hoảng (các mô hình thường không nhận ra ý định tự tử, như trong vụ việc năm 2024 ở Florida liên quan đến Character.AI). Phản ứng của ngành là an toàn – obvyazka – các cơ chế bên ngoài như tuyên bố từ chối trách nhiệm, đường dây nóng khủng hoảng, thang đo đã được xác thực (PHQ‑9, GAD‑7, thang Beck, HADS), bảng câu hỏi khủng hoảng (SCI‑2, SIS) và các biện pháp bảo mật. Tuy nhiên, tất cả các biện pháp này đều hoạt động ở lớp biên và không kiểm tra nội dung phản hồi thực tế. Một cách tiếp cận tiên tiến hơn, được triển khai bởi dịch vụ Vera, sử dụng hệ thống đa tác tử: một AI-nhà tâm lý học tạo ra phản hồi, một AI-giám sát viên xem xét giọng điệu và độ an toàn, và một AI-học thuật kiểm tra các khuyến nghị dựa trên bằng chứng. Vòng kiểm tra thứ hai này phát hiện xu nịnh và lời khuyên bịa đặt nhưng nhân số lượng lệnh gọi API lên, làm tăng chi phí và độ trễ. Trong số bảy dịch vụ trị liệu AI bằng tiếng Nga được khảo sát, chỉ có Vera tuyên bố có vòng kiểm tra thứ hai; các dịch vụ khác chỉ dựa vào các biện pháp bảo vệ lớp biên. Tác giả đặt câu hỏi ranh giới hợp lý nằm ở đâu giữa obvyazka lớp biên rẻ tiền và kiểm tra nội dung tốn kém, gợi ý rằng kiểm tra có chọn lọc có thể là một giải pháp trung gian.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới