smevals: una nueva herramienta para evaluar modelos, prompts y harnesses
OpenAI
Anthropic
Simon Willison presentó smevals, un nuevo framework para ejecutar pequeños conjuntos de pruebas de evaluación (evals) para diversas configuraciones de modelos y evaluar los resultados. La herramienta incluye comandos para ejecutar, evaluar y visualizar resultados, y admite la generación estática de informes en HTML.
Simon Willison, junto con el laboratorio de IA aplicada Prime Radiant de Jesse Vincent, ha desarrollado smevals, una nueva herramienta para ejecutar pequeños conjuntos de pruebas de evaluación (evals) para diversas configuraciones de modelos y evaluar los resultados. La herramienta permite a los usuarios crear conjuntos de evaluación como directorios con archivos YAML, ejecutarlos contra modelos como gpt-5.5 y claude-opus-4.6, y luego evaluar los resultados mediante comprobaciones definidas. Para analizar los resultados, se incluyen un servidor web local y un comando para generar un informe HTML estático. Willison señaló que esta es su tercera iteración de su enfoque de evals y planea expandir la herramienta en el futuro.
Fuente: Simon Willison —
original
