Supabase julkistaa Evals-vertailuympäristön avoimena lähdekoodina: tekoälykoodausagenttien arviointi oikeilla tehtävillä
Anthropic
OpenAI
Moonshot AI
Supabase on julkaissut avoimen lähdekoodin Supabase Evals -vertailuympäristön ja viitekehyksen, joka testaa, kuinka hyvin tekoälykoodausagentit rakentavat Supabasea käyttäen. Se ajaa agentteja, kuten Claude Code, Codex ja OpenCode, oikeita tehtäviä vasten, arvioiden tulokset yhdistelmällä deterministisiä tarkistuksia ja kielimalli-tuomaria. Viitekehys on saatavilla Apache-2.0-lisenssillä ja tukee julkista tulostaulua.
Supabase on julkaissut avoimen lähdekoodin Supabase Evals -työkalun, joka on vertailu- ja testausympäristö tekoälyagenttien Supabase-rakennustaitojen arviointiin. Se ajaa koodausagentteja, kuten Claude Code, Codex ja OpenCode, oikeita tehtäviä vasten, kuten skeeman rakentaminen, epäonnistuneen Edge Functionin debuggaaminen tai rikkinäisen RLS-käytännön korjaaminen, ja pisteyttää tulokset. Vertailu toimii julkisen tulostaulun (leaderboard) pohjana osoitteessa supabase.com/evals ja sisäisenä regressiotestisarjana, jota seurataan päivittäin. Viitekehys on saatavilla Apache-2.0-lisenssillä ja toimii paikallisesti pnpm:n avulla. Skenaariot kattavat eri ulottuvuuksia, kuten tuotteet (tietokanta, autentikointi, tallennus) ja aiheet (RLS, tietoturva), ja jokainen skenaario ajetaan oikeaa kontitettua Supabase-pinoa vasten. Pisteytys yhdistää deterministiset tarkistukset LLM-tuomariin (LLM-as-a-judge), ja agenteille annetaan yksi yritys uudelleen. Keskeiset havainnot osoittavat, että huippumallit, kuten Opus 5 ja Kimi K3, saavuttivat 100 % ilman apua, kun taas taidot (skills) auttoivat pienempiä malleja kuromaan eroa umpeen. Heikkouksia ovat käsin kirjoitetut migraatiot deklaratiivisten skeemojen sijaan, manuaalinen autentikoinnin varmistus ja epäjohdonmukainen dokumentaation käyttö agenttien kesken.
Lähde: MarkTechPost —
Alkuperäinen
