Исследователи проанализировали ограничения метода раздельного конформного прогнозирования (split conformal prediction) при работе с данными, подверженными сдвигу распределения. Выяснилось, что при сохранении общего уровня покрытия на целевом уровне, точность распознавания отдельных классов может критически падать. Это создает иллюзию надежности системы, скрывая ошибки в специфических условиях, что критично для систем компьютерного зрения и классификации.

Стандартные бенчмарки часто содержат скрытый сдвиг распределения, так как обучающие и тестовые выборки разделены по условиям. В таких сценариях классические методы оценки часто демонстрируют стабильное «маргинальное покрытие» (marginal coverage) около 90%, однако на уровне отдельных классов (per-class coverage) показатели оказываются значительно ниже. Авторы работы исследуют сложность разметки, необходимую для достижения корректного покрытия в условиях, когда распределение данных в продакшене отличается от тренировочного.

Исследование подчеркивает необходимость перехода от оценки усредненных метрик к анализу устойчивости моделей на уровне отдельных категорий. Это особенно важно для систем, работающих с динамическими данными, где условия среды постоянно меняются, а цена ошибки классификации конкретного объекта высока.

Ключевые факты

  • Метод раздельного конформного прогнозирования сохраняет маргинальное покрытие, но не гарантирует точность для отдельных классов при сдвиге распределения.
  • На реальных бенчмарках с распознаванием скелетов (cross-subject skeleton benchmark) общая точность покрытия остается на уровне 90%, маскируя провалы в специфических категориях.
  • Работа формализует понятие сложности разметки (label complexity) для обеспечения надежности прогнозов в условиях нестабильных входных данных.
  • Исследование указывает на системную уязвимость стандартных методов оценки ИИ-моделей, используемых в современных пайплайнах машинного обучения.