Исследователи проанализировали эффективность алгоритмов Sharpness-Aware Minimization (SAM) и оптимизатора Muon, сосредоточившись на их устойчивости к возмущениям параметров. Работа выявляет критическую зависимость качества обобщения моделей от геометрических свойств пространства весов. Авторы доказывают, что выбор метрики для оценки «малых» возмущений напрямую влияет на итоговую производительность нейросетей, предлагая новые подходы к настройке этих методов в процессе обучения.

Традиционные методы SAM стремятся минимизировать не только значение функции потерь, но и её чувствительность к изменениям весов, что помогает модели лучше адаптироваться к новым данным. Однако вопрос выбора оптимальной геометрии возмущений оставался открытым. Новое исследование связывает эффективность этих алгоритмов со спектральной нормой, предлагая более строгий математический фундамент для выбора гиперпараметров при обучении крупномасштабных моделей.

Использование Muon в связке с принципами SAM позволяет достичь более стабильной сходимости, особенно в задачах, где требуется высокая точность обобщения. Авторы демонстрируют, что правильный учет геометрии пространства параметров позволяет снизить риск переобучения и повысить робастность архитектур, что критически важно при работе с современными LLM и трансформерами, где количество параметров исчисляется миллиардами.

Ключевые факты

  • Исследование фокусируется на оптимизации Sharpness-Aware Minimization (SAM) через призму спектральной нормы.
  • Установлено, что эффективность SAM напрямую зависит от геометрической интерпретации «малых» возмущений параметров.
  • Работа предлагает теоретическое обоснование для выбора метрик, улучшающих обобщающую способность моделей.
  • Анализ охватывает взаимодействие алгоритма Muon с методами минимизации чувствительности функции потерь.
  • Результаты направлены на повышение стабильности обучения нейронных сетей при работе с большими объемами данных.