Компания Supabase выпустила инструмент Evals — открытый фреймворк для тестирования возможностей ИИ-агентов при работе с реальными задачами бэкенд-разработки. Система позволяет оценивать качество кода, создаваемого моделями вроде Claude Code, Codex и OpenCode, в изолированных контейнеризированных средах. Бенчмарк проверяет корректность выполнения специфических операций, таких как проектирование схем баз данных, отладка функций и настройка политик безопасности.
Процесс тестирования включает выполнение агентом цепочки действий, после чего система проводит проверку результата двумя способами. Первый — детерминированные тесты, подтверждающие работоспособность кода, второй — использование подхода «LLM-as-a-judge» для качественной оценки архитектурных решений. Такой подход позволяет разработчикам понять, насколько эффективно агент справляется с прикладными задачами в рамках конкретной инфраструктуры.
Использование контейнеров обеспечивает воспроизводимость результатов, исключая влияние внешних факторов на процесс оценки. Инструмент ориентирован на проверку навыков агентов в работе с RLS-политиками (Row Level Security), миграциями данных и Edge Functions, что делает его специализированным решением для оценки ИИ в контексте Fullstack-разработки.
Ключевые факты
- Фреймворк распространяется под лицензией Apache-2.0.
- Поддерживается тестирование популярных моделей и агентов, включая Claude Code, Codex и OpenCode.
- Оценка проводится в изолированных контейнеризированных стеках для обеспечения чистоты эксперимента.
- Методология включает как детерминированные проверки, так и оценку с помощью LLM-судьи.
- Основные сценарии тестирования охватывают создание схем БД, отладку Edge Functions и настройку RLS-политик.
