Исследователи представили архитектуру HCIG (Hierarchical Cross-Modal Incongruity Graph), предназначенную для выявления сарказма и кибербуллинга в мультимодальном контенте. Модель анализирует противоречия между текстовыми и визуальными данными, используя иерархический графовый подход. Это позволяет системе эффективнее улавливать скрытые смыслы и агрессивный подтекст, которые часто ускользают от стандартных методов анализа, полагающихся лишь на простое объединение признаков.

Традиционные подходы к мультимодальному анализу часто ограничиваются механизмами кросс-модального внимания или базовой конкатенацией векторов признаков. Однако сарказм и травля в сети часто строятся на тонком несоответствии между тем, что написано, и тем, что изображено на картинке или видео. Архитектура HCIG выстраивает многоуровневую графовую структуру, которая моделирует семантические разрывы на различных этапах обработки данных, обеспечивая более глубокое понимание контекста.

Разработка направлена на повышение точности модерации контента в социальных сетях. Использование графовых нейронных сетей позволяет модели учитывать сложные взаимосвязи между объектами и словами, что критически важно для классификации эмоционально окрашенных сообщений. Метод демонстрирует значительный прогресс в задачах, где прямое значение слов противоречит визуальному ряду, что является ключевой проблемой для современных систем автоматической фильтрации контента.

Ключевые факты

  • Архитектура HCIG использует иерархический графовый подход для сопоставления семантики текста и визуальных образов.
  • Модель специально спроектирована для детектирования сложных форм коммуникации, таких как сарказм и кибербуллинг.
  • Метод преодолевает ограничения классических моделей, которые не способны эффективно выявлять противоречия между модальностями.
  • Исследование сфокусировано на решении проблемы «неконгруэнтности» данных, где истинный смысл сообщения скрыт в конфликте между медиа-форматами.