Supabase запустила инструмент для оценки качества работы ИИ-агентов, интегрированный непосредственно в инфраструктуру базы данных. Решение позволяет разработчикам проводить A/B-тестирование промптов, отслеживать метрики точности и анализировать логи взаимодействий в режиме реального времени. Это упрощает процесс итерации над агентными системами, обеспечивая прозрачный контроль над качеством ответов и эффективностью использования токенов в рамках единой экосистемы.

Новый функционал ориентирован на решение проблемы «черного ящика» при разработке LLM-приложений. Разработчики получают возможность сохранять историю всех вызовов моделей, сравнивать результаты различных версий промптов и оценивать их влияние на конечный результат. Интеграция с базой данных позволяет хранить не только текстовые логи, но и векторные представления, что критически важно для отладки RAG-систем и сложных цепочек рассуждений агентов.

Платформа предоставляет инструменты для автоматизированного тестирования, где можно задать ожидаемые ответы и проверять соответствие им в автоматическом режиме. Это снижает зависимость от ручной проверки и ускоряет цикл разработки, позволяя быстрее внедрять изменения в логику агентов без риска деградации качества ответов. Система поддерживает версионирование промптов, что дает возможность откатываться к предыдущим конфигурациям при обнаружении ошибок.

Ключевые факты

  • Платформа позволяет проводить A/B-тестирование промптов для сравнения эффективности различных моделей и настроек.
  • Инструмент обеспечивает хранение полных логов взаимодействия агентов, включая метаданные и затраты токенов.
  • Реализована поддержка автоматизированной оценки ответов на основе заданных критериев и эталонных данных.
  • Интеграция с инфраструктурой Supabase позволяет использовать векторный поиск для анализа контекста, который агент использовал при генерации ответа.
  • Система поддерживает версионирование конфигураций, что упрощает отладку и управление изменениями в агентных пайплайнах.