Исследователи представили математическую модель, объясняющую возникновение «интрузивных размерностей» (intruder dimensions) при дообучении моделей методом LoRA. Эти компоненты, возникающие в матрицах весов, практически ортогональны предобученным векторам и провоцируют катастрофическое забывание. Авторы вывели формулу критической силы обновления, позволяющую предсказывать появление таких деструктивных векторов для каждого слоя нейросети на основе спектрального анализа.
Проблема катастрофического забывания при адаптации LLM часто связывается с изменением весов, которые нарушают внутреннюю структуру знаний, заложенную при основном обучении. Ранее механизмы этого процесса оставались эмпирическими, однако новая работа связывает появление «интрузивных» векторов с конкретными сингулярными значениями матриц адаптеров $A$ и $B$. Это позволяет инженерам точнее настраивать гиперпараметры, чтобы избежать деградации базовых способностей модели.
Теоретический подход авторов опирается на спектральный анализ обновленных матриц весов $W+BA$. Ученые доказали, что существует пороговое значение силы обновления, после которого модель начинает терять исходные знания из-за доминирования новых, не связанных с исходными данными векторов. Метод позволяет проводить диагностику слоев до начала обучения, что делает процесс дообучения более предсказуемым и контролируемым.
Ключевые факты
- «Интрузивные размерности» — это новые ведущие сингулярные векторы, которые возникают при обновлении весов и почти ортогональны исходным параметрам модели.
- Авторы вывели формулу критической силы обновления $s^\ast = \bar{\theta} / (\gamma \sigma_1(BA))$, которая предсказывает риск появления деструктивных векторов.
- Исследование позволяет проводить послойный анализ спектра весов для предотвращения катастрофического забывания.
- Математическая модель объясняет, почему чрезмерное изменение весов в LoRA-адаптерах приводит к потере обобщающей способности нейросети.