Исследователи представили CogVis — архитектуру для обнаружения изменений на спутниковых снимках, работающую с произвольными семантическими категориями. В отличие от традиционных методов, которые объединяют временное восприятие, семантическую классификацию и верификацию регионов в единый процесс, CogVis разделяет эти задачи. Это позволяет снизить вычислительную избыточность и повысить стабильность результатов при анализе динамики земной поверхности по текстовым запросам.

Существующие системы Open-Vocabulary Change Detection (OVCD) часто сталкиваются с нестабильностью из-за переплетения разнородных задач в рамках одной модели. Авторы CogVis вдохновлялись принципами человеческого визуального восприятия, где распознавание изменений происходит через разделение контекста сцены и конкретных объектов. Такой подход позволяет модели эффективно адаптироваться к новым категориям объектов без необходимости переобучения или сложной перенастройки для каждого отдельного запроса.

Архитектура CogVis минимизирует дублирование вычислений, что критически важно для обработки больших массивов геопространственных данных. Разделение этапов восприятия сцены и верификации изменений позволяет системе точнее фокусироваться на целевых объектах, игнорируя фоновые шумы и естественные вариации освещения или сезонности, которые часто приводят к ложным срабатываниям в классических моделях компьютерного зрения.

Ключевые факты

  • CogVis решает проблему избыточных вычислений в задачах Open-Vocabulary Change Detection (OVCD).
  • Модель разделяет временное восприятие, семантическую дискриминацию и верификацию регионов на независимые этапы.
  • Подход имитирует когнитивные механизмы человеческого зрения для более точного распознавания изменений.
  • Система поддерживает работу с произвольными семантическими категориями, задаваемыми через текстовые запросы.