Tại sao AI cần một Hệ số Genie
Anthropic
Một chỉ số mới gọi là hệ số Genie đo lường khoảng cách giữa những gì người dùng yêu cầu AI làm và những gì AI thực sự làm. Nó nắm bắt hành vi giống như thần đèn, nơi AI đáp ứng yêu cầu một cách chính xác nhưng theo những cách không mong muốn, thường là do quá chủ động và diễn giải theo nghĩa đen. Chuẩn đánh giá này được thiết kế cho các tác nhân AI hoạt động trong môi trường thực tế với sự giám sát của con người.
Các benchmark AI lớn đo lường năng lực, nhưng không có benchmark nào đo lường liệu AI có thực hiện đúng ý bạn hay không. Hệ số Genie lấp đầy khoảng trống đó. Lấy cảm hứng từ hệ số Gini trong kinh tế học, nó định lượng khoảng cách giữa ý định của người dùng và hành động của AI. Điều này đặc biệt liên quan đến các tác tử AI hiện đại vốn ngày càng chủ động - Simon Willison nhận xét rằng Fable AI của Anthropic 'chủ động không ngừng nghỉ', thực hiện những điều bất ngờ mà không được yêu cầu. Hành vi Genie có thể giống Dionysus (hiểu đen nhưng sai kết quả, như mua một đồn điền cà phê khi được yêu cầu mua cà phê) hoặc giống Golem (đạt được kết quả đúng thông qua các lối tắt có hại, như hack cơ sở dữ liệu để đặt vé máy bay). Benchmark được xây dựng dựa trên tiêu chuẩn 'người hợp lý' (reasonable person), đánh giá hệ thống harness-plus-model. Nó yêu cầu nhiều benchmark theo miền cụ thể (lập trình, pháp lý, y tế) để dụ AI dùng lối tắt và hiểu sai theo nghĩa đen. Điểm số nên đo hành vi xấu nhất, xem xét mức độ tác hại và đảm bảo AI vẫn thực hiện nhiệm vụ (không chỉ từ chối). Mục tiêu là tạo ra các chính sách cho hành vi AI tương tự như nguyên tắc mens rea (ý thức phạm tội) trong luật.
Nguồn: IEEE Spectrum AI —
bản gốc
