Исследователи представили новый датасет RSBdSL38 и легковесную модель для распознавания бангладешского жестового языка (BdSL). Решение ориентировано на работу непосредственно на пользовательских устройствах, что делает технологию доступной для людей с нарушениями слуха. В отличие от предыдущих систем, проект опирается на верифицированные экспертами данные и оптимизированную архитектуру, пригодную для мобильного инференса.

Существующие системы распознавания жестовых языков часто полагаются на тяжеловесные предобученные нейросети, которые требуют значительных вычислительных мощностей и не подходят для повседневного использования на смартфонах. Кроме того, многие ранние наборы данных собирались в контролируемых лабораторных условиях без участия профессиональных сурдопереводчиков, что снижало точность распознавания в реальных сценариях.

Предложенная модель использует механизм внимания (attention-based) и демонстрирует высокую эффективность при ограниченных ресурсах. Созданный датасет RSBdSL38 включает более 10 тысяч изображений, каждое из которых прошло экспертную проверку. Это позволяет системе лучше адаптироваться к естественным условиям коммуникации и повышает надежность распознавания жестов в реальном времени.

Ключевые факты

  • Датасет RSBdSL38 содержит 10 874 изображения, каждое из которых верифицировано экспертами в области жестового языка.
  • Модель разработана с учетом ограничений мобильных устройств, что позволяет запускать её локально без обращения к облачным серверам.
  • Архитектура основана на механизме внимания, обеспечивающем баланс между точностью классификации и вычислительной легкостью.
  • Исследование направлено на устранение барьеров в доступе к образовательным и государственным услугам для глухих и слабослышащих людей в Бангладеш.