Компания Together AI представила руководство по настройке автоскейлинга для эндпоинтов с LLM. Основная проблема заключается в том, что стандартные метрики загрузки GPU часто не отражают реальную очередь запросов, а длительное время холодного старта реплик приводит к задержкам. Инженеры предлагают методику выбора метрик, настройки окон масштабирования и управления бюджетом ресурсов для минимизации простоев.
При настройке инфраструктуры инференса важно учитывать разрыв между утилизацией GPU и временем отклика. Когда очередь запросов начинает расти, стандартные системы мониторинга могут показывать «здоровое» состояние системы, так как GPU еще не перегружены. Для эффективного масштабирования рекомендуется переходить от реактивного мониторинга к предиктивному, учитывая специфику обработки токенов и время инициализации моделей в памяти.
Авторы подчеркивают необходимость баланса между стоимостью и производительностью. Агрессивное масштабирование позволяет избежать очередей, но увеличивает затраты на содержание простаивающих реплик. В свою очередь, слишком консервативные настройки приводят к деградации пользовательского опыта. Оптимальная стратегия включает использование кастомных метрик, основанных на глубине очереди, и предварительный прогрев инстансов перед пиковыми нагрузками.
Ключевые факты
- Стандартные метрики загрузки GPU часто не коррелируют с задержками в очередях при работе с LLM.
- Время холодного старта новых реплик может достигать нескольких минут, что требует настройки окон масштабирования.
- Рекомендуется использовать метрики глубины очереди (queue depth) вместо чистого использования GPU для триггеров автоскейлинга.
- Эффективное управление бюджетом требует учета затрат на «прогрев» моделей при масштабировании инфраструктуры.
