HarnassenOpen Source 🇺🇸 01.08.2026 01:01

smevals: nieuwe tool voor het evalueren van modellen, prompts en harnesses

OpenAIOpenAI AnthropicAnthropic
Simon Willison heeft smevals geïntroduceerd, een nieuw framework voor het uitvoeren van kleine evaluatietests (evals) voor verschillende modelconfiguraties en het beoordelen van resultaten. De tool bevat commando's voor het uitvoeren, evalueren en visualiseren van resultaten en ondersteunt ook statische generatie van HTML-rapporten.
Simon Willison heeft samen met het Prime Radiant laboratorium voor toegepaste AI van Jesse Vincent smevals ontwikkeld — een nieuwe tool voor het draaien van kleine evaluatietestsets voor verschillende modelconfiguraties en het beoordelen van de resultaten. De tool stelt gebruikers in staat om eval-sets als mappen met YAML-bestanden te creëren, ze te draaien tegen modellen zoals gpt-5.5 en claude-opus-4.6, en vervolgens de resultaten te beoordelen met behulp van opgegeven controles. Voor de analyse van de resultaten zijn een lokale webserver en een opdracht voor het bouwen van een statisch HTML-rapport voorzien. Willison merkte op dat dit zijn derde iteratie is van de aanpak voor evals, en hij is van plan om de tool in de toekomst uit te breiden.
Bron: Simon Willison — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws