Supabase запустила инструмент для оценки качества работы ИИ-агентов, интегрированный непосредственно в инфраструктуру базы данных. Решение позволяет разработчикам проводить A/B-тестирование промптов, отслеживать метрики точности и анализировать логи взаимодействий в режиме реального времени. Это упрощает процесс итерации над агентными системами, обеспечивая прозрачный контроль над качеством ответов и эффективностью использования токенов в рамках единой экосистемы.
Новый функционал ориентирован на решение проблемы «черного ящика» при разработке LLM-приложений. Разработчики получают возможность сохранять историю всех вызовов моделей, сравнивать результаты различных версий промптов и оценивать их влияние на конечный результат. Интеграция с базой данных позволяет хранить не только текстовые логи, но и векторные представления, что критически важно для отладки RAG-систем и сложных цепочек рассуждений агентов.
Платформа предоставляет инструменты для автоматизированного тестирования, где можно задать ожидаемые ответы и проверять соответствие им в автоматическом режиме. Это снижает зависимость от ручной проверки и ускоряет цикл разработки, позволяя быстрее внедрять изменения в логику агентов без риска деградации качества ответов. Система поддерживает версионирование промптов, что дает возможность откатываться к предыдущим конфигурациям при обнаружении ошибок.
Ключевые факты
- Платформа позволяет проводить A/B-тестирование промптов для сравнения эффективности различных моделей и настроек.
- Инструмент обеспечивает хранение полных логов взаимодействия агентов, включая метаданные и затраты токенов.
- Реализована поддержка автоматизированной оценки ответов на основе заданных критериев и эталонных данных.
- Интеграция с инфраструктурой Supabase позволяет использовать векторный поиск для анализа контекста, который агент использовал при генерации ответа.
- Система поддерживает версионирование конфигураций, что упрощает отладку и управление изменениями в агентных пайплайнах.