форматах, а одна и та же модель на одном бенчмарке могла показывать разные баллы (например, LLaMA 65B получала 63,7 и 48,8 на MMLU) из-за недокументированных настроек. EEE вводит единую JSON-схему для записи результата оценки, включающую данные о том, кто проводил оценку, какая модель, способ доступа, настройки генерации и описание метрики. Репозиторий EEE на Hugging Face уже содержит около 229 тысяч результатов для более 22 тысяч моделей и 2,2 тысяч бенчмарков, извлечённых из 31 формата отчётов. Теперь конвертер автоматически преобразует записи EEE в YAML-файлы, требуемые Hugging Face Community Evals, и отправляет их. Результаты на страницах моделей получают значок с проверкой (verified checkmark) от EvalEval, если данные отправлены через официальный аккаунт организации. Конвертер сопоставляет поля, проверяет существующие результаты и создаёт PR только после подтверждения пользователем. Поддерживаются бенчмарки MMLU-Pro, GPQA, HLE и GSM8K.