하네스오픈 소스 🇺🇸 01.08.2026 01:01

smevals: 모델, 프롬프트 및 하네스를 평가하는 새로운 도구

OpenAIOpenAI AnthropicAnthropic
사이먼 윌리슨이 smevals를 소개했습니다. 이는 다양한 모델 구성에 대한 소규모 평가 세트를 실행하고 결과를 평가하기 위한 새로운 프레임워크입니다. 이 도구는 실행, 평가 및 결과 시각화를 위한 명령을 포함하며, 정적 HTML 보고서 생성을 지원합니다.
Саймон Уиллисон совместно с лабораторией прикладного ИИ Prime Radiant Джесси Винсента разработал smevals — новый инструмент для запуска небольших наборов оценочных тестов (evals) для различных конфигураций моделей и оценки результатов. Инструмент позволяет пользователям создавать eval-наборы в виде каталогов с YAML-файлами, запускать их против моделей, таких как gpt-5.5 и claude-opus-4.6, а затем оценивать результаты с помощью заданных проверок. Для анализа результатов предусмотрены локальный веб-сервер и команда сборки статического HTML-отчёта. Уиллисон отметил, что это его третья итерация подхода к эвалам, и он планирует расширять инструмент в будущем.
출처: Simon Willison — 원문
관련 게시물 ↓
새로운 뉴스