публичный лидерборд на supabase.com/evals и внутренний набор регрессионных тестов, отслеживаемый ежедневно. Фреймворк доступен под лицензией Apache-2.0 и запускается локально через pnpm. Сценарии покрывают такие измерения, как продукты (база данных, аутентификация, хранилище) и темы (RLS, безопасность), и каждый сценарий выполняется против реального контейнеризированного стека Supabase. Оценка сочетает детерминированные проверки с судьёй на основе LLM, и агенты получают одну попытку на повторное выполнение. Ключевые результаты показывают, что ведущие модели, такие как Opus 5 и Kimi K3, набрали 100% без посторонней помощи, в то время как навыки помогли меньшим моделям сократить разрыв. Слабые места включают рукописные миграции вместо декларативных схем, ручную проверку аутентификации и непоследовательное использование документации среди агентов.