Исследователи представили новый набор данных из 1600 примеров, написанных людьми, для оценки галлюцинаций в Vision-and-Language моделях. В отличие от существующих методов, полагающихся на генерацию ошибок самими нейросетями, этот подход позволяет создать независимый и долговечный стандарт тестирования, который не устаревает при выходе новых версий моделей и охватывает четыре мировых языка.
Проблема текущих бенчмарков заключается в их зависимости от конкретных архитектур: когда модели обучаются на данных, похожих на тестовые, результаты оценки становятся предвзятыми. Использование экспертной человеческой разметки позволяет выявлять тонкие логические и визуальные несоответствия, которые часто пропускают автоматизированные системы проверки. Это критически важно для повышения надежности мультимодальных систем в реальных сценариях использования.
Разработка охватывает широкий спектр визуальных контекстов, требующих глубокого понимания взаимосвязи между изображением и текстом. Такой подход помогает стандартизировать процесс верификации моделей, делая его более устойчивым к «заучиванию» ответов и обеспечивая объективное сравнение производительности между различными архитектурами, от проприетарных решений до открытых весов.
Ключевые факты
- Набор данных включает 1600 примеров, созданных и проверенных людьми.
- Поддерживаются четыре языка: английский, китайский, французский и другие.
- Методология исключает использование моделей для генерации тестовых вопросов, что предотвращает утечку данных в обучающие выборки.
- Бенчмарк ориентирован на выявление мелкозернистых галлюцинаций, где модель ошибочно интерпретирует детали изображения или их атрибуты.