Supabase открывает исходный код Evals: оценка ИИ-агентов для программирования на реальных задачах
Компания Supabase опубликовала в открытый доступ Supabase Evals — бенчмарк и инфраструктуру для оценки того, насколько хорошо ИИ-агенты для программирования работают с платформой Supabase. Инструмент запускает агентов, таких как Claude Code, Codex и OpenCode, на реальных задачах и оценивает результаты с помощью комбинации детерминированных проверок и использования LLM в роли судьи. Фреймворк доступен под лицензией Apache-2.0 и обеспечивает работу публичного рейтинга.
Supabase открыла исходный код Supabase Evals — бенчмарка и фреймворка для тестирования того, насколько хорошо AI-агенты создают проекты с использованием Supabase. Он запускает агентов кодирования, включая Claude Code, Codex и OpenCode, на реальных задачах, таких как создание схемы, отладка упавшей Edge Function или исправление сломанного RLS-полисиса, а затем оценивает результат. Бенчмарк питает
Показать ещё ↓
Источник: MarkTechPost —
оригинал
