오픈 소스에이전트 🇺🇸 01.08.2026 13:02

Supabase, Evals를 오픈소스로 공개: 실제 작업에서 AI 코딩 에이전트 벤치마킹

AnthropicAnthropic OpenAIOpenAI Moonshot AIMoonshot AI
Supabase가 Supabase Evals를 오픈소스로 공개했습니다. 이는 AI 코딩 에이전트가 Supabase로 얼마나 잘 구축하는지 테스트하는 벤치마크이자 프레임워크입니다. Claude Code, Codex, OpenCode와 같은 에이전트를 실제 작업에 투입하고, 결정적 검사와 LLM-as-a-judge(LLM을 심판으로 사용) 방식을 혼합하여 결과를 평가합니다. 이 프레임워크는 Apache-2.0 라이선스로 제공되며 공개 리더보드를 지원합니다.
Supabase는 Supabase Evals를 오픈소스로 공개했다. 이는 AI 에이전트가 Supabase를 사용하여 얼마나 잘 구축하는지 테스트하기 위한 벤치마크 및 프레임워크이다. Claude Code, Codex, OpenCode와 같은 코딩 에이전트를 실제 작업(예: 스키마 구축, 실패한 Edge Function 디버깅, 손상된 RLS 정책 수정)에 대해 실행하고 결과를 점수화한다. 이 벤치마크는 supabase.com/evals의 공개 리더보드와 매일 모니터링되는 내부 회귀 테스트 스위트를 지원한다. 프레임워크는 Apache-2.0 라이선스로 제공되며 pnpm을 통해 로컬에서 실행된다. 시나리오는 제품(데이터베이스, 인증, 스토리지) 및 주제(RLS, 보안)와 같은 차원을 다루며, 각 시나리오는 실제 컨테이너화된 Supabase 스택을 대상으로 실행된다. 점수 계산은 결정적 검사와 LLM-as-a-judge를 결합하며, 에이전트는 한 번의 재시도를 할 수 있다. 주요 발견 사항으로는 Opus 5 및 Kimi K3와 같은 최고 모델이 도움 없이 100%를 달성한 반면, 스킬은 더 작은 모델이 격차를 줄이는 데 도움이 되었다는 점이 있다. 약점으로는 선언적 스키마 대신 수동으로 작성된 마이그레이션, 수동 인증 확인, 그리고 에이전트 간 일관되지 않은 문서 사용이 포함된다.
출처: MarkTechPost — 원문
관련 게시물 ↓
새로운 뉴스