Nghiên cứu 🇺🇸 27.07.2026 09:06

Tất cả Kết quả Eval Hiện có trên Trang Mô hình Hugging Face

Hugging FaceHugging Face MetaMeta
Dự án EEE (Every Eval Ever), do Liên minh EvalEval khởi xướng, chuẩn hóa báo cáo đánh giá AI bằng cách sử dụng một lược đồ JSON thống nhất. Hiện đã được tích hợp với Hugging Face Community Evals, cho phép liên kết chéo giữa các trang mô hình và hồ sơ đánh giá đầy đủ, với hơn 229.000 kết quả từ 31 định dạng đã được thu thập.
Dự án EEE (Every Eval Ever - Mọi Đánh Giá Từng Có), ra mắt vào tháng 2 năm 2026 bởi Liên minh EvalEval, nhằm mục đích chuẩn hóa báo cáo đánh giá trí tuệ nhân tạo (AI) trên các đơn vị đánh giá độc lập và bên thứ nhất. Dự án sử dụng một lược đồ JSON thống nhất ghi lại ai đã thực hiện đánh giá, mô hình nào, cách truy cập, cài đặt sinh, định nghĩa chỉ số và kết quả đầu ra tùy chọn cho từng mẫu. Hugging Face cũng ra mắt Community Evals (Đánh giá Cộng đồng) cùng thời điểm để phân tán báo cáo điểm chuẩn trên Hub. Hai hệ thống này hiện đã được tích hợp: người đóng góp có thể gửi kết quả EEE đến Community Evals của Hugging Face thông qua một bộ chuyển đổi, biến đổi các bản ghi JSON thành định dạng YAML mà Hugging Face yêu cầu. Các điểm số thu được sẽ xuất hiện trên trang mô hình với một huy hiệu liên kết đến bản ghi EEE đầy đủ, bao gồm cấu hình sinh, phiên bản khung đánh giá và ghi chú về khả năng tái tạo. Kho dữ liệu EEE trên Hugging Face hiện có khoảng 229.000 kết quả đánh giá trên hơn 22.000 mô hình và 2.200 điểm chuẩn, được trích xuất từ 31 định dạng báo cáo khác nhau. Việc tái tạo các lần chạy này từ đầu sẽ tiêu tốn hàng trăm nghìn đô la Mỹ, nhấn mạnh giá trị của báo cáo tập trung. Bộ chuyển đổi hiện hỗ trợ bốn điểm chuẩn chính thức: MMLU-Pro, GPQA, HLE và GSM8K. Người dùng có thể gửi bản ghi EEE của mình đến kho dữ liệu, sau đó chạy bộ chuyển đổi để tạo bản xem trước YAML và mở yêu cầu kéo (pull request) sau khi được xem xét.
Nguồn: Hugging Face blog — bản gốc
Bài viết liên quan trước đây ↓
Tin mới