Исследователи обнаружили, что качество работы диффузионных моделей напрямую зависит от структуры псевдослучайных чисел, используемых на аппаратном уровне. Поскольку генераторы случайных чисел в современных процессорах детерминированы, их последовательности становятся «обучаемыми» входными данными. Это напрямую влияет на градиенты при обучении и итоговую точность генерации изображений, выявляя скрытую зависимость между архитектурой модели и вычислительным железом.
Традиционно считается, что диффузионные модели работают со случайным шумом, однако на практике этот шум генерируется алгоритмически. Авторы работы доказали, что конкретные орбиты псевдослучайных чисел, потребляемые моделью в процессе оптимизации, не являются нейтральными. Они формируют специфические паттерны, которые модель «запоминает» и использует для минимизации функции потерь, что может приводить к непредсказуемым искажениям в генерации при смене аппаратной платформы.
Данное открытие ставит под сомнение воспроизводимость результатов обучения моделей на разных типах оборудования. Если структура псевдослучайных чисел становится частью весов или стратегии обучения, то перенос модели с одной архитектуры GPU на другую может потребовать дополнительной калибровки. Это исследование открывает новое направление в оптимизации стабильности диффузионных моделей и повышении их предсказуемости в продакшн-средах.
Ключевые факты
- Диффузионные модели используют детерминированные псевдослучайные последовательности вместо истинного хаоса из-за ограничений аппаратного обеспечения.
- Структура этих последовательностей влияет на градиенты в процессе обучения, делая их «обучаемым» компонентом системы.
- Изменение аппаратной платформы может приводить к деградации качества генерации из-за различий в реализации генераторов случайных чисел.
- Результаты исследования подчеркивают необходимость учета аппаратных особенностей при масштабировании и переносе весов предобученных моделей.