Character.AI

Tin tức, mô hình và bản phát hành AI mới nhất từ Character.AI.

An toàn AI 🇷🇺

Cách ngăn chặn tâm lý gia AI khỏi xu nịnh và ảo giác: phân tích kỹ thuật về các biện pháp bảo vệ an toàn

Bài viết xem xét lý do tại sao các mô hình ngôn ngữ lớn đa năng lại nguy hiểm khi đảm nhận vai trò sức khỏe tâm thần do xu nịnh, ảo giác và mù khủng hoảng. Nó phân tích các lớp bảo vệ an toàn (như tuyên bố miễn trừ, quy trình xử lý khủng hoảng, thang đo đã được xác thực) và nêu bật kiến trúc đa tác tử (ví dụ: Vera) nơi một tác tử giám sát AI thứ hai và người đánh giá học thuật kiểm tra mọi phản hồi. Sự đánh đổi là chi phí và độ trễ cao hơn cho việc đánh giá cấp nội dung, và tác giả đặt câu hỏi nên cân bằng giữa an toàn và chi phí ở đâu.

Character.AICharacter.AI
Habr — хаб ИИ29.07 · 16:01
Tin mới