smevals : un nouvel outil pour évaluer les modèles, les prompts et les harnais
OpenAI
Anthropic
Simon Willison a présenté smevals, un nouveau framework pour exécuter de petits ensembles de tests d'évaluation (evals) pour différentes configurations de modèles et pour évaluer les résultats. L'outil inclut des commandes pour exécuter, évaluer et visualiser les résultats, et prend en charge la génération statique de rapports HTML.
Simon Willison, en collaboration avec le laboratoire d'IA appliquée Prime Radiant de Jesse Vincent, a développé smevals, un nouvel outil permettant d'exécuter de petits ensembles de tests d'évaluation (evals) pour différentes configurations de modèles et d'évaluer les résultats. L'outil permet aux utilisateurs de créer des ensembles d'évaluation sous forme de répertoires contenant des fichiers YAML, de les exécuter sur des modèles tels que gpt-5.5 et claude-opus-4.6, puis d'évaluer les résultats à l'aide de vérifications définies. Pour analyser les résultats, un serveur web local et une commande de génération de rapport HTML statique sont prévus. Willison a indiqué qu'il s'agit de sa troisième itération de cette approche des évaluations, et qu'il prévoit d'étendre l'outil à l'avenir.
Source: Simon Willison —
original
