Исследователи представили модель для агрегации меток в задачах краудсорсинга с сильным дисбалансом классов. Метод учитывает зависимость точности разметчиков от конкретного класса, что критически важно для систем контроля качества, где редкие события представляют наибольшую ценность. Подход позволяет эффективнее выявлять миноритарные классы, минимизируя ошибки, возникающие при стандартном усреднении оценок исполнителей.

В реальных сценариях, таких как промышленная дефектоскопия или медицинская диагностика, разметчики часто демонстрируют разную степень надежности: одни эксперты лучше распознают редкие аномалии, другие — типичные случаи. Традиционные алгоритмы агрегации часто игнорируют этот нюанс, что приводит к смещению предсказаний в сторону мажоритарного класса. Предложенная модель математически формализует поведение разметчиков, позволяя динамически взвешивать их вклад в итоговую метку.

Авторы работы сосредоточились на ситуациях, когда разметчики могут быть надежны в отношении одного класса, но ошибаться в другом. Использование такой модели позволяет повысить качество обучающих выборок для систем машинного обучения, работающих с критически важными, но редкими данными, где цена ошибки при пропуске целевого события крайне высока.

Ключевые факты

  • Разработан алгоритм для агрегации меток в условиях дисбаланса классов, где редкие события являются приоритетными.
  • Модель учитывает класс-зависимую точность каждого разметчика, а не только общую статистику его работы.
  • Исследование направлено на решение проблем в системах инспекции, где критически важные данные встречаются крайне редко.
  • Метод позволяет снизить влияние некачественной разметки миноритарных классов на итоговую точность обучающего набора.