Supabase publica en código abierto Evals: evaluación de agentes de codificación de IA en tareas reales
Anthropic
OpenAI
Moonshot AI
Supabase ha publicado en código abierto Supabase Evals, un benchmark y marco de trabajo que evalúa qué tan bien los agentes de codificación de IA construyen con Supabase. Ejecuta agentes como Claude Code, Codex y OpenCode contra tareas reales, calificando los resultados con una combinación de comprobaciones deterministas y LLM como juez. El marco está disponible bajo Apache-2.0 y alimenta una clasificación pública.
Supabase ha lanzado código abierto de Supabase Evals, un benchmark y marco de trabajo para evaluar qué tan bien los agentes de IA construyen con Supabase. Ejecuta agentes de codificación, incluidos Claude Code, Codex y OpenCode, contra tareas reales como crear un esquema, depurar una Edge Function fallida o corregir una política RLS rota, y luego califica el resultado. El benchmark impulsa un leaderboard público en supabase.com/evals y una suite de regresión interna monitoreada a diario. El marco está disponible bajo Apache-2.0 y se ejecuta localmente mediante pnpm. Los escenarios cubren dimensiones como productos (base de datos, autenticación, almacenamiento) y temas (RLS, seguridad), y cada uno se ejecuta contra una pila real de Supabase en contenedores. La calificación combina verificaciones deterministas con LLM-como-juez, y los agentes tienen un reintento. Los hallazgos clave muestran que los mejores modelos como Opus 5 y Kimi K3 obtuvieron un 100% sin ayuda, mientras que las habilidades ayudaron a los modelos más pequeños a cerrar la brecha. Las debilidades incluyen migraciones escritas a mano en lugar de esquemas declarativos, verificación manual de autenticación y uso inconsistente de la documentación entre los agentes.
Fuente: MarkTechPost —
original
