Команда Manifest объявила об отказе от собственного LLM-роутера, аргументируя это избыточной сложностью и неоправданными накладными расходами. Вместо автоматической маршрутизации запросов между моделями разработчики перешли к использованию одной высокопроизводительной модели для большинства задач. Этот шаг подчеркивает сдвиг в индустрии: простота архитектуры часто оказывается эффективнее, чем попытки оптимизировать стоимость через динамический выбор LLM.

Основная проблема роутеров заключается в добавлении критической точки отказа и увеличении задержки (latency) при каждом запросе. В процессе эксплуатации выяснилось, что затраты на поддержку инфраструктуры маршрутизации, настройку правил и мониторинг качества ответов превышают экономию, полученную от использования более дешевых моделей для простых задач. Разработчики пришли к выводу, что предсказуемость поведения системы важнее, чем маржинальная выгода от переключения между API разных провайдеров.

Переход на унифицированную модель упрощает отладку, тестирование и интеграцию с инструментами оценки качества (evals). В условиях быстрого удешевления топовых моделей (таких как GPT-4o или Claude 3.5 Sonnet) разница в цене между «умной» и «быстрой» моделью становится менее значимой для большинства бизнес-кейсов, что делает сложные системы маршрутизации избыточными для большинства продакшн-решений.

Ключевые факты

  • Разработчики Manifest отказались от использования LLM-роутера в пользу прямой интеграции с конкретными моделями.
  • Основными причинами отказа стали рост задержек, сложность поддержки инфраструктуры и непредсказуемость ответов при смене моделей.
  • Анализ показал, что экономия на стоимости токенов при использовании роутера не покрывает операционные расходы на его обслуживание.
  • Унификация модели упрощает процесс тестирования и внедрения метрик качества (evals) в рабочие процессы.
  • Современный тренд показывает, что стабильность и простота архитектуры становятся приоритетнее микрооптимизации затрат на инференс.