HarnessSumber Terbuka 🇺🇸 01.08.2026 01:01

smevals: alat baru untuk mengevaluasi model, prompt, dan harness

OpenAIOpenAI AnthropicAnthropic
Simon Willison memperkenalkan smevals — kerangka kerja baru untuk menjalankan rangkaian uji evaluasi (evals) dalam skala kecil untuk berbagai konfigurasi model dan menilai hasilnya. Alat ini mencakup perintah untuk menjalankan, mengevaluasi, dan memvisualisasikan hasil, serta mendukung pembuatan laporan HTML statis.
Саймон Уиллисон bersama laboratorium AI terapan Prime Radiant milik Джесси Винсента mengembangkan smevals — alat baru untuk menjalankan rangkaian tes evaluasi (evals) kecil untuk berbagai konfigurasi model dan menilai hasilnya. Alat ini memungkinkan pengguna membuat set eval sebagai direktori berisi file YAML, menjalankannya terhadap model seperti gpt-5.5 dan claude-opus-4.6, lalu mengevaluasi hasilnya menggunakan pemeriksaan yang ditentukan. Untuk analisis hasil, tersedia server web lokal dan perintah untuk membangun laporan HTML statis. Willison mencatat bahwa ini adalah iterasi ketiganya dalam pendekatan terhadap eval, dan dia berencana untuk mengembangkan alat ini lebih lanjut di masa depan.
Sumber: Simon Willison — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru