Инженеры Ramp представили метод динамического выбора модели для обработки запросов, основанный на алгоритме Thompson Sampling. Система в реальном времени обучается распределять задачи между различными LLM, балансируя между стоимостью инференса и качеством ответов. Такой подход позволяет значительно снизить расходы на API, сохраняя высокую точность выполнения задач в продакшн-среде.

В основе решения лежит концепция многорукого бандита, которая позволяет системе постоянно адаптироваться к изменениям в производительности моделей. Вместо жестко заданных правил или статической маршрутизации, алгоритм оценивает вероятность того, какая модель лучше справится с конкретным промптом, минимизируя при этом затраты на токены. Это особенно эффективно для систем, где поток запросов неоднороден по сложности.

Метод решает проблему «переплаты» за использование мощных моделей там, где достаточно более дешевых аналогов. Система автоматически собирает фидбек о качестве ответов, что позволяет ей со временем уточнять веса для каждой модели в роутере. Такой подход превращает процесс выбора LLM из статической настройки в непрерывный процесс оптимизации инфраструктуры.

Ключевые факты

  • Алгоритм Thompson Sampling используется для решения задачи многорукого бандита при выборе модели.
  • Метод позволяет динамически переключаться между дорогими и дешевыми моделями в зависимости от сложности запроса.
  • Система минимизирует общие затраты на инференс, сохраняя целевой уровень качества ответов.
  • Решение реализовано в продакшн-инфраструктуре компании Ramp для оптимизации работы с LLM.
  • Подход обеспечивает непрерывное обучение роутера на основе данных о результатах обработки запросов.