Исследователи представили метод Confidence-Adaptive Routing, оптимизирующий работу Mixture-of-Experts (MoE) в архитектурах LoRA. Вместо фиксированного количества экспертов для каждого токена, система динамически распределяет вычислительные ресурсы на основе уверенности модели. Это позволяет экономить ресурсы на простых запросах и направлять больше мощности на сложные задачи, повышая общую эффективность инференса без потери качества генерации.
Традиционные MoE-модели используют жесткий параметр k, определяющий количество экспертов для обработки каждого токена. Такой подход избыточен для простых токенов, где модель уверена в ответе, и недостаточен для случаев, требующих глубокой проработки. Новый метод использует распределение вероятностей на выходе роутера как индикатор уверенности: пиковое распределение сигнализирует о высокой уверенности, тогда как плоское указывает на необходимость привлечения дополнительных экспертов.
Внедрение адаптивной маршрутизации позволяет сократить среднее количество активных параметров на токен, что напрямую влияет на скорость инференса и потребление памяти. Метод не требует переобучения всей модели, так как опирается на уже существующие сигналы роутера, что делает его перспективным решением для оптимизации LLM в продакшн-средах с ограниченными вычислительными мощностями.
Ключевые факты
- Метод Confidence-Adaptive Routing динамически меняет количество экспертов для каждого токена в зависимости от уверенности роутера.
- Использование распределения вероятностей роутера позволяет выявлять «сложные» токены без дополнительных вычислительных затрат.
- Подход оптимизирует архитектуру Mixture-of-Experts LoRA, снижая избыточность вычислений на простых задачах.
- Технология позволяет гибко балансировать между скоростью инференса и точностью модели в реальном времени.