smevals:モデル、プロンプト、ハーネスを評価するための新しいツール
OpenAI
Anthropic
サイモン・ウィリソン氏は、さまざまなモデル構成に対して小規模な評価テスト(イーバルス)を実行し、結果を評価するための新しいフレームワーク「smevals」を発表しました。このツールには、実行、評価、結果の可視化を行うコマンドが含まれており、静的HTMLレポートの生成にも対応しています。
サイモン・ウィリソンは、ジェシー・ヴィンセントの応用AIラボ Prime Radiant と共同で、さまざまなモデル構成に対して小規模な評価テストセット(evals)を実行し、結果を評価するための新しいツール「smevals」を開発した。このツールにより、ユーザーはYAMLファイルを含むディレクトリ形式で評価セットを作成し、gpt-5.5やclaude-opus-4.6などのモデルに対して実行し、その後、指定されたチェックを使用して結果を評価できる。結果の分析には、ローカルウェブサーバーと静的HTMLレポートを生成するコマンドが用意されている。ウィリソンは、これが彼の評価に対するアプローチの3回目の反復であり、将来このツールを拡張する予定であると述べた。
出典: Simon Willison —
原文
