HarnessesOpen Source 🇺🇸 01.08.2026 01:01

smevals: новый инструмент для оценки моделей, промптов и харнессов

OpenAIOpenAI AnthropicAnthropic
Саймон Уиллисон представил smevals — новый фреймворк для запуска небольших наборов оценочных тестов (evals) для различных конфигураций моделей и оценки результатов. Инструмент включает команды для запуска, оценки и визуализации результатов, а также поддерживает статическую генерацию HTML-отчётов.
Саймон Уиллисон совместно с лабораторией прикладного ИИ Prime Radiant Джесси Винсента разработал smevals — новый инструмент для запуска небольших наборов оценочных тестов (evals) для различных конфигураций моделей и оценки результатов. Инструмент позволяет пользователям создавать eval-наборы в виде каталогов с YAML-файлами, запускать их против моделей, таких как gpt-5.5 и claude-opus-4.6, а затем оценивать результаты с помощью заданных проверок. Для анализа результатов предусмотрены локальный веб-сервер и команда сборки статического HTML-отчёта. Уиллисон отметил, что это его третья итерация подхода к эвалам, и он планирует расширять инструмент в будущем.
Source: Simon Willison — original
Our earlier posts on this topic ↓
Fresh news