Sumber TerbukaAgen 🇺🇸 01.08.2026 13:02

Supabase Membuka Sumber Evals: Tolok Ukur Agen Koding AI pada Tugas Nyata

AnthropicAnthropic OpenAIOpenAI Moonshot AIMoonshot AI
Supabase telah membuka sumber Supabase Evals, sebuah tolok ukur dan kerangka kerja yang menguji seberapa baik agen koding AI membangun dengan Supabase. Kerangka ini menjalankan agen seperti Claude Code, Codex, dan OpenCode untuk menyelesaikan tugas nyata, dengan penilaian hasil menggunakan campuran pemeriksaan deterministik dan LLM-sebagai-juri (LLM-as-a-judge). Kerangka kerja ini tersedia di bawah lisensi Apache-2.0 dan mendukung papan peringkat publik.
Supabase telah merilis sumber terbuka Supabase Evals, sebuah tolok ukur dan kerangka kerja untuk menguji seberapa baik agen AI menggunakan Supabase. Kerangka kerja ini menjalankan agen pengkodean termasuk Claude Code, Codex, dan OpenCode untuk mengerjakan tugas nyata seperti membangun skema, men-debug Edge Function yang gagal, atau memperbaiki kebijakan RLS yang rusak, lalu menilai hasilnya. Tolok ukur ini mendukung papan peringkat publik di supabase.com/evals dan rangkaian regresi internal yang dipantau setiap hari. Kerangka kerja ini tersedia di bawah lisensi Apache-2.0 dan berjalan secara lokal melalui pnpm. Skenario mencakup dimensi seperti produk (database, auth, storage) dan topik (RLS, keamanan), dan setiap skenario dijalankan terhadap tumpukan Supabase kontainer nyata. Penilaian menggabungkan pemeriksaan deterministik dengan LLM-sebagai-juri, dan agen diberi satu kali percobaan ulang. Temuan utama menunjukkan bahwa model teratas seperti Opus 5 dan Kimi K3 mencapai skor 100% tanpa bantuan, sementara keterampilan membantu model yang lebih kecil menutup kesenjangan. Kelemahan termasuk migrasi yang ditulis tangan alih-alih skema deklaratif, verifikasi auth manual, dan penggunaan dokumentasi yang tidak konsisten di antara agen.
Sumber: MarkTechPost — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru