Supabase выпустила открытый бенчмарк для оценки AI-агентов на реальных задачах
Supabase представила Supabase Evals — открытый бенчмарк и фреймворк для оценки того, насколько хорошо AI-агенты умеют работать с платформой. Он запускает агентов (Claude Code, Codex, OpenCode) на реальных задачах: построить схему, отладить сбойную Edge Function, исправить сломанную RLS-политику. Результаты попадают на публичный лидерборд supabase.com/evals и во внутренний регрессионный набор, который обновляется ежедневно.
Бенчмарк оценивает агентов по трём измерениям: продукты (база данных, аутентификация, storage, edge-functions, realtime, cron, очереди, векторы, data-api), темы (RLS, безопасность, миграции, SQL, SDK, observability, self-hosting, тесты, декларативная схема) и стадии (build, deploy, investigate, resolve). Сценарии основаны на реальных тикетах поддержки, баг-репортах и GitHub issues. Они делятся на два набора: бенчмарк-сценарии (широта, публикуются) и регрессионные (известные сбои, обновляются ежедневно, не влияют на опубликованные баллы).
Каждый сценарий выполняется в реальном окружении: фреймворк поднимает стек, похожий на hosted, и локальный CLI-проект в контейнерах, так что агенты вызывают настоящий MCP-сервер и CLI. Оценка комбинирует детерминированные проверки и LLM-as-a-judge. Агентам даётся одна попытка на повтор перед выставлением оценки. Код бенчмарка открыт под лицензией Apache-2.0 и доступен на GitHub в репозитории supabase/evals, работает локально через pnpm.