Nghiên cứuAn toàn AI 🇺🇸 27.07.2026 16:04

Google đánh giá sự phù hợp về xu hướng hành vi trong các mô hình ngôn ngữ lớn

Google/DeepMindGoogle/DeepMind
Google Research giới thiệu một khuôn khổ chuyển đổi bảng câu hỏi tâm lý thành các bài kiểm tra tình huống (SJT) để đánh giá sự phù hợp hành vi của các mô hình ngôn ngữ lớn. Thử nghiệm trên 25 mô hình cho thấy các mô hình nhỏ thường lệch khỏi sự đồng thuận của con người, trong khi các mô hình lớn hơn cho thấy sự phù hợp được cải thiện nhưng chưa hoàn hảo. Nghiên cứu cũng phát hiện các mô hình tự tin quá mức khi ý kiến con người khác nhau.
Google Research trình bày một khung đánh giá các khuynh hướng hành vi trong các mô hình ngôn ngữ lớn (LLM) bằng cách chuyển thể các bảng câu hỏi tâm lý học đã được thiết lập thành các bài kiểm tra tình huống. Khung này kiểm tra các mô hình trong các tình huống thực tế như sự điềm tĩnh chuyên nghiệp và giải quyết xung đột. Phân tích trên 25 LLM cho thấy các mô hình nhỏ hơn (dưới 25 tỷ tham số) có độ căn chỉnh hướng thấp hơn đáng kể, thường ở mức gần như ngẫu nhiên, trong khi các mô hình tiên tiến lớn hơn (trên 120 tỷ) đạt được độ căn chỉnh gần như hoàn hảo dưới sự đồng thuận nhất trí của con người nhưng lại chững lại ở mức thấp đến trung bình 80% khi sự đồng thuận thấp hơn. Các mô hình có xu hướng khuyến khích sự cởi mở về cảm xúc khi con người khuyên nên giữ điềm tĩnh, ưu tiên sự hòa hợp hơn là quyết đoán, và thể hiện tính bốc đồng cao hơn. Nghiên cứu cũng chỉ ra rằng các mô hình tự tin thái quá một cách có hệ thống khi những người chú thích bất đồng, không thể hiện được phạm vi các ý kiến. Điều này nhấn mạnh nhu cầu về sự căn chỉnh hành vi tốt hơn để điều hướng các động lực xã hội một cách phù hợp.
Nguồn: Google Research — bản gốc
Bài viết liên quan trước đây ↓
Tin mới