모든 Eval 결과, 이제 Hugging Face 모델 페이지에서 확인 가능
Hugging Face
Meta
EvalEval Coalition이 출시한 EEE(Every Eval Ever) 프로젝트는 통합된 JSON 스키마를 사용하여 AI 평가 보고를 표준화합니다. 이제 Hugging Face Community Evals와 통합되어 모델 페이지와 전체 평가 기록 간의 상호 링크가 가능해졌으며, 31개 형식의 229,000개 이상의 결과가 이미 수집되었습니다.
EEE(Every Eval Ever) 프로젝트는 2026년 2월 EvalEval Coalition에 의해 시작되었으며, 1차 및 3차 평가자 간 AI 평가 보고를 표준화하는 것을 목표로 합니다. 이 프로젝트는 누가 평가를 실행했는지, 어떤 모델인지, 어떻게 접근했는지, 생성 설정, 메트릭 정의, 선택적 샘플별 출력을 기록하는 통합 JSON 스키마를 사용합니다. 동시에 Hugging Face는 허브에서 벤치마크 점수 보고를 분산화하기 위해 Community Evals를 출시했습니다. 이제 두 시스템이 통합되어, 기여자는 JSON 레코드를 Hugging Face가 요구하는 YAML 형식으로 변환하는 변환기를 통해 EEE 결과를 Hugging Face Community Evals로 보낼 수 있습니다. 결과 점수는 전체 EEE 기록(생성 설정, 하네스 버전, 재현성 노트 포함)으로 연결되는 배지와 함께 모델 페이지에 표시됩니다. Hugging Face의 EEE 데이터 저장소는 31가지 다른 보고 형식에서 추출된 약 22,000개 이상의 모델과 2,200개 이상의 벤치마크에 걸쳐 약 229,000개의 평가 결과로 성장했습니다. 이러한 실행을 처음부터 재현하려면 수십만 달러의 비용이 들며, 이는 중앙 집중식 보고의 가치를 강조합니다. 변환기는 현재 MMLU-Pro, GPQA, HLE, GSM8K의 4가지 공식 벤치마크를 지원합니다. 사용자는 EEE 기록을 데이터 저장소에 제출한 다음 변환기를 실행하여 YAML 미리보기를 생성하고 검토 후 풀 리퀘스트를 열 수 있습니다.
출처: Hugging Face blog —
원문
