Código AbertoAgentes 🇺🇸 01.08.2026 13:02

Supabase disponibiliza Evals em código aberto: benchmark de agentes de IA em tarefas reais

AnthropicAnthropic OpenAIOpenAI Moonshot AIMoonshot AI
A Supabase disponibilizou o Supabase Evals em código aberto, um benchmark e framework que testa o desempenho de agentes de codificação de IA ao desenvolver com a Supabase. Ele executa agentes como Claude Code, Codex e OpenCode em tarefas reais, avaliando os resultados com uma combinação de verificações determinísticas e avaliação por LLM como juiz. O framework está disponível sob a licença Apache-2.0 e alimenta um ranking público.
A Supabase lançou como código aberto o Supabase Evals, um benchmark e framework para testar o quão bem agentes de IA constroem usando a Supabase. Ele executa agentes de codificação, incluindo Claude Code, Codex e OpenCode, em tarefas reais, como criar um esquema, depurar uma Edge Function com falha ou corrigir uma política de RLS quebrada, e depois pontua o resultado. O benchmark alimenta um leaderboard público em supabase.com/evals e uma suíte de regressão interna monitorada diariamente. O framework está disponível sob a licença Apache-2.0 e é executado localmente via pnpm. Os cenários abrangem dimensões como produtos (banco de dados, autenticação, armazenamento) e tópicos (RLS, segurança), e cada um é executado contra uma pilha real da Supabase em contêiner. A pontuação combina verificações determinísticas com LLM-como-juiz, e os agentes têm uma nova tentativa. Principais descobertas mostram que modelos de ponta, como Opus 5 e Kimi K3, alcançaram 100% sem ajuda, enquanto habilidades ajudaram modelos menores a reduzir a diferença. As fraquezas incluem migrações escritas à mão em vez de esquemas declarativos, verificação manual de autenticação e uso inconsistente de documentação entre os agentes.
Fonte: MarkTechPost — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas