Supabase maakt Evals open source: AI-codeeragents benchmarken op echte taken
Anthropic
OpenAI
Moonshot AI
Supabase heeft Supabase Evals open source gemaakt, een benchmark en framework dat test hoe goed AI-codeeragents met Supabase kunnen bouwen. Het draait agents zoals Claude Code, Codex en OpenCode tegen echte taken en scoort resultaten met een mix van deterministische controles en LLM-as-a-judge. Het framework is beschikbaar onder Apache-2.0 en ondersteunt een openbare leaderboard.
Supabase heeft Supabase Evals open source gemaakt, een benchmark en framework voor het testen hoe goed AI-agenten met Supabase kunnen bouwen. Het draait codeeragenten zoals Claude Code, Codex en OpenCode tegen echte taken, zoals het bouwen van een schema, het debuggen van een mislukte Edge Function of het repareren van een gebroken RLS-beleid, en beoordeelt vervolgens het resultaat. De benchmark vormt de basis voor een openbaar leaderboard op supabase.com/evals en een interne regressiesuite die dagelijks wordt gemonitord. Het framework is beschikbaar onder Apache-2.0 en draait lokaal via pnpm. Scenario's bestrijken dimensies zoals producten (database, authenticatie, opslag) en onderwerpen (RLS, beveiliging), en elk scenario draait tegen een echte containerized Supabase-stack. De scoring combineert deterministische controles met LLM-as-a-judge, en agenten krijgen één herkansing. Belangrijkste bevindingen tonen aan dat topmodellen zoals Opus 5 en Kimi K3 een score van 100% behaalden zonder hulp, terwijl vaardigheden kleinere modellen hielpen om het gat te dichten. Zwakke punten zijn onder andere handgeschreven migraties in plaats van declaratieve schema's, handmatige authenticatieverificatie en inconsistent documentatiegebruik onder agenten.
Bron: MarkTechPost —
origineel
