AraçlarAçık Kaynak 🇺🇸 01.08.2026 01:01

smevals: modelleri, promptları ve harness'ları değerlendirmek için yeni bir araç

OpenAIOpenAI AnthropicAnthropic
Simon Willison, çeşitli model yapılandırmaları için küçük değerlendirme test setleri (eval) çalıştırmak ve sonuçları değerlendirmek amacıyla smevals adlı yeni bir çerçeve tanıttı. Araç, çalıştırma, değerlendirme ve sonuçları görselleştirme komutlarını içerir ve statik HTML raporlarının oluşturulmasını destekler.
Саймон Уиллисон, вместе с Джесси Винсентом из лаборатории прикладного ИИ Prime Radiant, разработал smevals - новый инструмент для запуска небольших наборов оценочных тестов (evals) для различных конфигураций моделей и оценки результатов. Инструмент позволяет пользователям создавать eval-наборы в виде каталогов с YAML-файлами, запускать их против моделей, таких как gpt-5.5 и claude-opus-4.6, а затем оценивать результаты с помощью заданных проверок. Для анализа результатов предусмотрены локальный веб-сервер и команда сборки статического HTML-отчёта. Уиллисон отметил, что это его третья итерация подхода к эвалам, и он планирует расширять инструмент в будущем.
Kaynak: Simon Willison — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler