Исследователи выявили фундаментальное различие в поведении оптимизаторов при обучении матрично-факторизованных моделей. В то время как классический градиентный спуск демонстрирует неявное смещение в сторону низкоранговых решений, алгоритм Adam, несмотря на идентичные условия инициализации, этого свойства лишен. Разница кроется в калибровочной симметрии функции потерь и способности оптимизатора сохранять её в процессе обучения.

Авторы работы доказывают, что механизм поиска низкоранговых структур доступен оптимизатору только при условии его калибровочной эквивариантности. В случае с градиентным потоком эта симметрия сохраняется, что позволяет модели естественным образом стремиться к более простым, низкоранговым представлениям данных. Adam же, за счет адаптивного изменения масштаба градиентов для каждого параметра, нарушает эту симметрию, что препятствует проявлению аналогичного эффекта.

Это открытие объясняет, почему выбор алгоритма оптимизации может критически влиять на архитектурные свойства итоговой модели, даже если формально обе стратегии минимизируют одну и ту же функцию потерь. Понимание того, как адаптивные методы оптимизации взаимодействуют с геометрией пространства параметров, становится важным фактором при проектировании глубоких нейронных сетей и систем с матричной факторизацией.

Ключевые факты

  • Исследование фокусируется на поведении моделей вида W = UVᵀ, где градиентный спуск проявляет неявное смещение к низкоранговым решениям.
  • Установлено, что Adam не обладает этим свойством из-за нарушения калибровочной эквивариантности, присущей функции потерь.
  • Ключевым условием для формирования низкоранговых решений является инвариантность оптимизатора относительно преобразований (U, V) ↦ (UQ, VQ).
  • Адаптивное масштабирование градиентов в Adam препятствует сохранению симметрии, что меняет динамику сходимости по сравнению с обычным градиентным спуском.