Исследователи представили Theia — систему для автоматизированного описания и проверки мультимодальных данных, направленную на решение проблемы нехватки качественных датасетов для обучения Vision-Language Models (VLM). Инструмент позволяет эффективно обрабатывать масштабные наборы данных, такие как Incidents1M, устраняя семантические расхождения между изображениями и текстовыми описаниями, что критически важно для методов дистилляции знаний без исходных данных.

Разработка фокусируется на повышении надежности моделей, работающих в критических сценариях, например, при ликвидации последствий стихийных бедствий. Существующие наборы данных часто страдают от отсутствия описаний или низкого качества разметки, что ограничивает возможности переноса знаний. Theia автоматизирует процесс создания точных подписей к изображениям, обеспечивая высокую степень соответствия между визуальным контентом и текстом.

Применение предложенного подхода позволяет значительно улучшить качество обучения компактных моделей через дистилляцию, используя крупные предобученные VLM в качестве «учителей». Это снижает зависимость от дорогостоящей ручной разметки и минимизирует ошибки в интерпретации визуальных данных, что является ключевым фактором для внедрения ИИ в системы оперативного реагирования и управления чрезвычайными ситуациями.

Ключевые факты

  • Система Theia разработана для автоматизации описания и валидации мультимодальных данных в крупном масштабе.
  • Метод направлен на исправление проблем семантического несоответствия в датасетах, таких как Incidents1M и CrisisMMD.
  • Технология оптимизирует процесс дистилляции знаний без исходных данных (Data-Free Knowledge Distillation).
  • Решение повышает точность работы Vision-Language Models в критически важных отраслях, включая управление чрезвычайными ситуациями.