Supabase 开源 Evals:在真实任务上对 AI 编程代理进行基准测试
Anthropic
OpenAI
Moonshot AI
Supabase 已开源 Supabase Evals,这是一个基准测试框架,用于评估 AI 编程代理在 Supabase 上的构建能力。它让诸如 Claude Code、Codex 和 OpenCode 等代理在真实任务上运行,并通过确定性检查与“大语言模型作为裁判”相结合的方式对结果进行评分。该框架采用 Apache-2.0 许可证,并支持一个公开排行榜。
Supabase 已开源 Supabase Evals,这是一个用于测试 AI 代理使用 Supabase 构建能力的基准测试与框架。它针对真实任务(如构建模式、调试失败的边缘函数或修复损坏的 RLS 策略)运行编码代理(包括 Claude Code、Codex 和 OpenCode),然后对结果进行评分。该基准测试为 supabase.com/evals 上的公开排行榜和内部每日回归测试套件提供支持。该框架采用 Apache-2.0 许可,可通过 pnpm 在本地运行。测试场景涵盖多个维度,如产品(数据库、身份验证、存储)和主题(RLS、安全性),并针对真实的容器化 Supabase 堆栈运行。评分结合了确定性检查和以 LLM 作为评判者的方式,代理有一次重试机会。主要发现显示,像 Opus 5 和 Kimi K3 这样的顶级模型在无辅助情况下得分 100%,而技能辅助帮助较小的模型缩小了差距。弱点包括使用手写迁移而非声明式模式、手动身份验证验证,以及代理之间文档使用不一致。
来源: MarkTechPost —
原文
