Исследователи представили новый подход к оценке визуального сходства изображений, который учитывает контекстуальные предпочтения человека. В отличие от традиционных метрик, сводящих сравнение к единому скалярному значению, предложенный метод позволяет задавать фокус внимания через текстовые промпты. Это дает возможность оценивать сходство объектов по конкретным признакам, таким как форма, цвет или текстура, что критически важно для развития генеративных моделей.
Существующие алгоритмы восприятия часто игнорируют тот факт, что человеческое суждение о схожести двух объектов зависит от поставленной задачи. Например, два изображения могут считаться идентичными по геометрии, но совершенно разными по цветовой гамме. Новый метод решает эту проблему, используя специально собранный масштабный датасет человеческих оценок визуального сходства на основе триплетов изображений.
Разработка направлена на создание более гибких инструментов для оценки качества генерации изображений и поиска по визуальным данным. Внедрение текстового управления метрикой позволяет разработчикам точнее настраивать модели компьютерного зрения, чтобы их «взгляд» на контент лучше соответствовал ожиданиям пользователей в различных прикладных сценариях.
Ключевые факты
- Разработана метрика, позволяющая задавать критерии визуального сходства с помощью естественного языка.
- Создан масштабный датасет человеческих суждений о сходстве, основанный на анализе триплетов изображений.
- Метод устраняет ограничение классических метрик, которые ранее не могли учитывать контекстуальные аспекты при сравнении объектов.
- Решение повышает точность оценки генеративных моделей, позволяя разделять такие параметры, как форма, цвет и стилистические особенности.