框架开源 🇺🇸 01.08.2026 01:01

smevals:评估模型、提示词与工具链的新工具

OpenAIOpenAI AnthropicAnthropic
Simon Willison 推出了 smevals——一个用于对多种模型配置运行小型评估测试集(evals)并评估结果的新框架。该工具包含用于运行、评估和可视化结果的命令,并支持静态生成 HTML 报告。
西蒙·威利森与杰西·文森特的Prime Radiant应用人工智能实验室合作开发了smevals——一款新工具,用于针对不同模型配置运行小型评估测试集(evals)并评估结果。该工具允许用户以包含YAML文件的目录形式创建评估集,针对诸如gpt-5.5和claude-opus-4.6之类的模型运行这些评估集,然后通过指定的检查来评估结果。为了分析结果,提供了本地Web服务器和用于构建静态HTML报告的构建命令。威利森表示,这是他在评估方法上的第三次迭代,并计划未来扩展该工具。
来源: Simon Willison — 原文
我们之前关于此话题的帖子 ↓
最新新闻