Исследователи представили новый подход к маршрутизации в архитектурах Mixture of LoRA Experts (MoLE). Вместо стандартного выбора экспертов на основе неопределенности модели, авторы предлагают использовать метрику «ценности информации» (Value-of-Information). Это позволяет эффективнее распределять вычислительные ресурсы, активируя только те адаптеры, которые действительно вносят вклад в точность предсказания, а не просто реагируют на высокую энтропию модели.

Традиционные динамические роутеры часто совершают ошибку, приравнивая неопределенность к необходимости дополнительных вычислений. В таких системах модель может активировать множество экспертов для «шумных» или неразрешимых данных, что ведет к избыточным затратам ресурсов без улучшения качества ответа. Новый алгоритм оценивает потенциальный прирост полезной информации от каждого эксперта, что позволяет оптимизировать инференс и повысить эффективность использования параметров в PEFT-моделях.

Метод позволяет динамически адаптировать вычислительный бюджет в зависимости от сложности конкретного запроса. Это особенно актуально для развертывания крупных моделей на ограниченном железе, где каждый дополнительный активный адаптер увеличивает задержку. Предложенный подход демонстрирует, что интеллектуальное управление маршрутизацией позволяет достичь более высокой точности при меньшем количестве активных параметров по сравнению с классическими методами на основе уверенности.

Ключевые факты

  • Алгоритм заменяет эвристику неопределенности на расчет ценности информации для выбора экспертов.
  • Метод оптимизирует работу Mixture of LoRA Experts, снижая избыточность вычислений при обработке сложных запросов.
  • Подход позволяет точнее определять, когда привлечение дополнительного эксперта действительно улучшит результат, а когда оно бесполезно.
  • Исследование направлено на повышение эффективности Parameter-Efficient Fine-Tuning (PEFT) в многоадаптерных системах.