Open SourceAgenten 🇺🇸 01.08.2026 13:02

Supabase veröffentlicht Evals als Open Source: Benchmarking von KI-Codierungsagenten bei realen Aufgaben

AnthropicAnthropic OpenAIOpenAI Moonshot AIMoonshot AI
Supabase hat Supabase Evals als Open Source veröffentlicht, ein Benchmark und Framework, das testet, wie gut KI-Codierungsagenten mit Supabase arbeiten. Es führt Agenten wie Claude Code, Codex und OpenCode gegen reale Aufgaben aus und bewertet die Ergebnisse mit einer Mischung aus deterministischen Prüfungen und LLM-als-Juror. Das Framework ist unter Apache-2.0 verfügbar und betreibt eine öffentliche Bestenliste.
Supabase hat Supabase Evals als Open Source veröffentlicht, ein Benchmark und Framework zum Testen, wie gut KI-Agenten mit Supabase arbeiten. Es führt Codierungsagenten wie Claude Code, Codex und OpenCode gegen reale Aufgaben aus, wie zum Beispiel das Erstellen eines Schemas, das Debuggen einer fehlgeschlagenen Edge Function oder das Beheben einer defekten RLS-Richtlinie, und bewertet dann das Ergebnis. Der Benchmark speist eine öffentliche Bestenliste unter supabase.com/evals sowie eine interne täglich überwachte Regressionssuite. Das Framework ist unter Apache-2.0 verfügbar und läuft lokal über pnpm. Die Szenarien decken Dimensionen wie Produkte (Datenbank, Authentifizierung, Speicher) und Themen (RLS, Sicherheit) ab, und jedes läuft gegen einen echten containerisierten Supabase-Stack. Die Bewertung kombiniert deterministische Prüfungen mit LLM-als-Judge, und Agenten erhalten einen erneuten Versuch. Wichtige Erkenntnisse zeigen, dass Top-Modelle wie Opus 5 und Kimi K3 ohne Hilfe 100% erreichten, während Fähigkeiten kleineren Modellen halfen, den Rückstand zu verringern. Zu den Schwächen gehören handgeschriebene Migrationen statt deklarativer Schemata, manuelle Authentifizierungsüberprüfung und inkonsistente Nutzung der Dokumentation durch die Agenten.
Quelle: MarkTechPost — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten