Исследователи выявили критические недостатки в существующих методах оценки генеративных моделей временных рядов, содержащих «точечные массы» (point masses) — ситуации, где данные часто принимают одно и то же значение, например, нулевой спрос или отсутствие осадков. Стандартные протоколы тестирования часто игнорируют эту специфику, что приводит к искаженным результатам и неверной интерпретации качества моделей при прогнозировании реальных бизнес-процессов.
Авторы работы указывают, что популярный метод «скользящего начала» (rolling-origin) может оценивать модель на временных окнах, структура которых принципиально отличается от характеристик всего набора данных. В результате метрики показывают высокую точность, которая не отражает реальную способность модели улавливать редкие, но значимые события, выходящие за рамки доминирующих нулевых значений.
Исследование подчеркивает необходимость пересмотра подходов к бенчмаркингу в задачах прогнозирования спроса, логистики и метеорологии. Игнорирование атомарной структуры данных при обучении и валидации ведет к тому, что модели «заучивают» статистический шум или константные значения, теряя чувствительность к динамическим изменениям в периоды высокой волатильности.
Ключевые факты
- Выявлено, что стандартные протоколы оценки часто игнорируют распределение вероятностей в данных с высокой концентрацией на одном значении.
- Продемонстрировано, что текущие бенчмарки могут давать завышенные показатели качества для моделей, которые не способны адекватно обрабатывать редкие события.
- Предложены рекомендации по адаптации протоколов валидации для учета специфической структуры временных рядов с точечными массами.
- Работа акцентирует внимание на рисках использования стандартных метрик в критически важных отраслях, таких как управление цепочками поставок и планирование ресурсов.