Together AI представила архитектуру управления выделенными мощностями для инференса моделей, основанную на трехуровневой модели ресурсов: эндпоинтах, деплойментах и конфигурациях. Система использует механизм маршрутизации с учетом доступной емкости, что позволяет динамически распределять нагрузку и обеспечивать стабильную работу высокопроизводительных LLM в продакшн-средах, минимизируя задержки и оптимизируя использование вычислительных ресурсов.

В основе подхода лежит разделение логических и физических уровней инфраструктуры. Эндпоинты выступают в роли точек доступа, к которым обращаются приложения, в то время как деплойменты отвечают за физическое размещение моделей на конкретных кластерах GPU. Конфигурации позволяют гибко настраивать параметры выполнения, включая квантование и лимиты параллельных запросов, что критически важно при масштабировании агентных систем.

Ключевым элементом системы является маршрутизация, осведомленная о текущей загрузке (capacity-aware routing). Она автоматически направляет входящие запросы на наиболее подходящие деплойменты, учитывая текущую доступность GPU и специфические требования конкретной конфигурации. Это исключает перегрузку отдельных узлов и обеспечивает предсказуемое время отклика при работе с тяжелыми моделями.

Ключевые факты

  • Трехуровневая модель ресурсов включает эндпоинты (точки входа), деплойменты (развертывание моделей) и конфигурации (параметры исполнения).
  • Маршрутизация с учетом емкости (capacity-aware routing) динамически балансирует нагрузку между доступными вычислительными узлами.
  • Система поддерживает тонкую настройку параметров инференса для оптимизации производительности под конкретные задачи.
  • Архитектура ориентирована на снижение задержек и повышение отказоустойчивости при работе с выделенными инстансами моделей.