Исследователи представили методы SignMuon и MuonSign, позволяющие сжимать обновления оптимизатора Muon до одного бита на параметр. Этот подход значительно снижает требования к пропускной способности при обучении моделей, сохраняя при этом эффективность оптимизации. Новые методы превосходят стандартный SignSGD, предлагая более производительное решение для матрично-ориентированной оптимизации в условиях жестких ограничений по передаче данных.

Оптимизатор Muon, ставший популярным благодаря своей способности эффективно обновлять веса нейронных сетей, традиционно требует передачи полных матриц, что создает узкое место в распределенных системах обучения. Авторы работы предложили использовать поэлементный знак (sign) для сжатия, что позволяет радикально сократить объем передаваемой информации. Это критически важно для крупномасштабных задач, где коммуникационные задержки между узлами становятся основным фактором, замедляющим процесс обучения.

В ходе экспериментов выяснилось, что простая операция взятия знака до или после применения линейного оракула минимизации (LMO) имеет свои особенности. Несмотря на высокую эффективность сжатия, авторы отмечают фундаментальные ограничения, связанные с обратной связью по ошибке (error feedback). Исследование демонстрирует, что даже при экстремальном сжатии до одного бита, алгоритм сохраняет способность к сходимости, что открывает новые возможности для оптимизации распределенного обучения моделей с миллиардами параметров.

Ключевые факты

  • Разработаны два метода сжатия: SignMuon и MuonSign, работающие на уровне одного бита на параметр.
  • Методы обеспечивают существенное снижение коммуникационных затрат при сохранении матричной структуры обновлений.
  • Практические тесты показывают превосходство новых подходов над классическим алгоритмом SignSGD.
  • Выявлены теоретические ограничения метода, связанные с поведением на линейных функциях и механизмами коррекции ошибок.