smevals: nova ferramenta para avaliar modelos, prompts e harnesses
OpenAI
Anthropic
Simon Willison apresentou o smevals — um novo framework para executar pequenos conjuntos de testes de avaliação (evals) para diversas configurações de modelos e avaliar os resultados. A ferramenta inclui comandos para execução, avaliação e visualização de resultados, além de suportar a geração estática de relatórios em HTML.
Simon Willison, em conjunto com o laboratório de IA aplicada Prime Radiant de Jesse Vincent, desenvolveu o smevals — uma nova ferramenta para executar pequenos conjuntos de testes de avaliação (evals) para várias configurações de modelos e avaliar os resultados. A ferramenta permite que os usuários criem conjuntos de avaliação como diretórios com arquivos YAML, executem-nos contra modelos como gpt-5.5 e claude-opus-4.6 e, em seguida, avaliem os resultados usando verificações definidas. Para a análise dos resultados, estão previstos um servidor web local e um comando de compilação de relatório HTML estático. Willison observou que esta é a sua terceira iteração da abordagem de avaliações e planeja expandir a ferramenta no futuro.
Fonte: Simon Willison —
original
