Supabase Evals Açık Kaynak Oldu: Gerçek Görevlerde Yapay Zeka Kodlama Ajanlarını Değerlendirme
Anthropic
OpenAI
Moonshot AI
Supabase, Supabase Evals'ı açık kaynak olarak yayınladı. Bu, yapay zeka kodlama ajanlarının Supabase ile ne kadar iyi çalıştığını test eden bir kıyaslama ve çerçevedir. Claude Code, Codex ve OpenCode gibi ajanları gerçek görevlerde çalıştırır ve sonuçları deterministik kontroller ile yapay zeka tabanlı değerlendirici (LLM-as-a-judge) karışımıyla puanlar. Çerçeve, Apache-2.0 lisansı altında sunulmaktadır ve halka açık bir lider tablosunu desteklemektedir.
Supabase, Supabase Evals'i açık kaynak olarak yayınladı. Bu, AI ajanlarının Supabase kullanarak ne kadar iyi iş çıkardığını test eden bir kıyaslama (benchmark) ve çerçevedir (framework). Claude Code, Codex ve OpenCode gibi kodlama ajanlarını, şema oluşturma, başarısız bir Edge Function'ı hata ayıklama veya bozuk bir RLS politikasını düzeltme gibi gerçek görevlerde çalıştırır ve ardından sonucu puanlar. Kıyaslama, supabase.com/evals adresindeki herkese açık bir lider tablosunu ve günlük olarak izlenen dahili bir regresyon paketini destekler. Çerçeve Apache-2.0 lisansı altında mevcuttur ve pnpm aracılığıyla yerel olarak çalışır. Senaryolar, ürünler (veritabanı, kimlik doğrulama, depolama) ve konular (RLS, güvenlik) gibi boyutları kapsar ve her biri gerçek bir konteynırlaştırılmış Supabase yığınında çalışır. Puanlama, deterministik kontrolleri yapay zeka jürisi (LLM-as-a-judge) ile birleştirir ve ajanlara bir kez yeniden deneme hakkı tanınır. Temel bulgular, Opus 5 ve Kimi K3 gibi en iyi modellerin yardımsız %100 puan aldığını, becerilerin (skills) ise daha küçük modellerin açığı kapatmasına yardımcı olduğunu gösteriyor. Zayıf yönler arasında bildirimsel şemalar yerine elle yazılmış geçişler (migrations), manuel kimlik doğrulama kontrolü ve ajanlar arasında tutarsız dokümantasyon kullanımı yer alıyor.
Kaynak: MarkTechPost —
orijinal
