Supabase open source son référentiel Evals : benchmark des agents de codage IA sur des tâches réelles
Anthropic
OpenAI
Moonshot AI
Supabase a publié en open source Supabase Evals, un référentiel et framework qui teste la capacité des agents de codage IA à construire avec Supabase. Il fait passer à des agents comme Claude Code, Codex et OpenCode des tâches réelles, évaluant les résultats à l'aide d'un mélange de contrôles déterministes et d'un juge de type LLM. Le framework est disponible sous licence Apache-2.0 et alimente un classement public.
Supabase a open source Supabase Evals, un benchmark et un framework pour tester l'efficacité des agents IA à construire avec Supabase. Il exécute des agents de codage, notamment Claude Code, Codex et OpenCode, sur des tâches réelles comme la création d'un schéma, le débogage d'une Edge Function en échec ou la correction d'une politique RLS cassée, puis évalue le résultat. Le benchmark alimente un classement public sur supabase.com/evals et une suite de tests de régression interne surveillée quotidiennement. Le framework est disponible sous licence Apache-2.0 et s'exécute localement via pnpm. Les scénarios couvrent des dimensions telles que les produits (base de données, authentification, stockage) et les sujets (RLS, sécurité), et chacun s'exécute sur une pile Supabase réelle conteneurisée. L'évaluation combine des vérifications déterministes avec un juge LLM, et les agents disposent d'un seul essai supplémentaire. Les principales conclusions montrent que les meilleurs modèles comme Opus 5 et Kimi K3 ont obtenu un score de 100% sans aide, tandis que les compétences ont aidé les modèles plus petits à combler l'écart. Les points faibles incluent des migrations écrites à la main au lieu de schémas déclaratifs, une vérification manuelle de l'authentification et une utilisation incohérente de la documentation parmi les agents.
Source: MarkTechPost —
original
