Исследователи представили MaLoRA — метод адаптации языковых моделей, который дополняет стандартные LoRA-адаптеры селективной рекуррентностью в пространстве состояний. В отличие от статических обновлений весов, этот подход позволяет модели динамически адаптироваться к конкретным токенам и контексту, значительно повышая эффективность рассуждений и точность обработки сложных последовательностей без необходимости полного дообучения параметров модели.
Традиционные методы низкоранговой адаптации (LoRA) применяют одинаковые изменения ко всем входным данным, что ограничивает гибкость модели при работе с разнородными задачами. MaLoRA внедряет механизм, который учитывает вариативность на уровне отдельных токенов и экземпляров. Это позволяет модели более точно фокусироваться на релевантной информации внутри контекстного окна, имитируя поведение архитектур типа Mamba, но в рамках привычных трансформерных структур.
Данный подход решает проблему «статичности» адаптеров, когда одна и та же матрица коррекции применяется ко всем типам запросов. Благодаря интеграции селективного состояния, модель получает возможность «выбирать», какие части скрытого представления требуют модификации в зависимости от текущего токена. Это особенно критично для задач, требующих глубокого логического вывода и удержания долгосрочных зависимостей, где стандартные методы часто теряют точность.
Ключевые факты
- MaLoRA внедряет селективную рекуррентность в пространстве состояний на двух уровнях: токена и экземпляра.
- Метод преодолевает ограничения статических LoRA-адаптеров, которые не учитывают динамические изменения входных данных.
- Технология сочетает преимущества трансформеров с эффективностью архитектур на базе State-Space Models (SSM).
- Метод ориентирован на улучшение способностей моделей к логическому выводу (reasoning) при сохранении низких вычислительных затрат на обучение.