FrameworksOpen Source 🇺🇸 01.08.2026 01:01

smevals: Ein neues Tool zur Bewertung von Modellen, Prompts und Harnesses

OpenAIOpenAI AnthropicAnthropic
Simon Willison hat smevals vorgestellt – ein neues Framework zum Ausführen kleiner Bewertungssätze (Evals) für verschiedene Modellkonfigurationen und zur Bewertung der Ergebnisse. Das Tool umfasst Befehle zum Ausführen, Bewerten und Visualisieren von Ergebnissen und unterstützt außerdem die statische Generierung von HTML-Berichten.
Simon Willison hat zusammen mit dem Labor für angewandte KI Prime Radiant von Jesse Vincent smevals entwickelt – ein neues Werkzeug zum Ausführen kleiner Bewertungssets (Evals) für verschiedene Modellkonfigurationen und zur Auswertung der Ergebnisse. Das Werkzeug ermöglicht es Nutzern, Eval-Sets als Verzeichnisse mit YAML-Dateien zu erstellen, sie gegen Modelle wie GPT-5.5 (gpt-5.5) und Claude Opus 4.6 (claude-opus-4.6) laufen zu lassen und die Ergebnisse anschließend mit festgelegten Checks zu bewerten. Für die Analyse der Ergebnisse sind ein lokaler Webserver und ein Befehl zum Erstellen statischer HTML-Berichte vorgesehen. Willison merkte an, dass dies seine dritte Iteration des Ansatzes für Evals sei, und er plant, das Werkzeug in Zukunft zu erweitern.
Quelle: Simon Willison — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten