Исследователи представили BanglaWild — специализированный набор данных из 2535 изображений для оценки моделей распознавания текста на бенгальском языке в естественных условиях. Бенчмарк заполняет пробел в области OCR и Vision-Language моделей, предлагая единую платформу для тестирования систем, которые ранее были ограничены лишь рукописными документами или простыми вывесками, не учитывающими сложность реальной визуальной среды.
Распознавание текста в «диких» условиях (in-the-wild) традиционно сталкивается с проблемами сложного фона, искажений перспективы и низкого качества изображений. Существующие ресурсы для бенгальского языка часто фокусировались на идеальных условиях или узких задачах, что не позволяло объективно сравнивать классические OCR-системы и современные мультимодальные модели (VLM). BanglaWild предлагает стандартизированный подход, позволяющий оценивать точность моделей на одних и тех же данных.
Авторы проекта подчеркивают, что использование единого набора данных для разных классов архитектур поможет выявить слабые места в обработке нелатинских алфавитов. Это критически важно для развития глобальных ИИ-решений, так как большинство текущих инструментов оптимизированы преимущественно для английского языка, оставляя значительные сегменты мировых языков без качественной поддержки в задачах компьютерного зрения.
Ключевые факты
- Набор данных включает 2535 изображений бенгальского текста, снятых в реальных условиях.
- Бенчмарк предназначен для сравнительного анализа классических OCR-систем и современных Vision-Language моделей.
- Проект решает проблему отсутствия стандартизированных метрик для распознавания бенгальского текста вне контролируемой среды.
- Исследование направлено на устранение языкового неравенства в развитии технологий компьютерного зрения.