Команда Manifest объявила об отказе от собственного LLM-роутера, аргументируя это избыточной сложностью и неоправданными накладными расходами. Вместо автоматической маршрутизации запросов между моделями разработчики перешли к использованию одной высокопроизводительной модели для большинства задач. Этот шаг подчеркивает сдвиг в индустрии: простота архитектуры часто оказывается эффективнее, чем попытки оптимизировать стоимость через динамический выбор LLM.
Основная проблема роутеров заключается в добавлении критической точки отказа и увеличении задержки (latency) при каждом запросе. В процессе эксплуатации выяснилось, что затраты на поддержку инфраструктуры маршрутизации, настройку правил и мониторинг качества ответов превышают экономию, полученную от использования более дешевых моделей для простых задач. Разработчики пришли к выводу, что предсказуемость поведения системы важнее, чем маржинальная выгода от переключения между API разных провайдеров.
Переход на унифицированную модель упрощает отладку, тестирование и интеграцию с инструментами оценки качества (evals). В условиях быстрого удешевления топовых моделей (таких как GPT-4o или Claude 3.5 Sonnet) разница в цене между «умной» и «быстрой» моделью становится менее значимой для большинства бизнес-кейсов, что делает сложные системы маршрутизации избыточными для большинства продакшн-решений.
Ключевые факты
- Разработчики Manifest отказались от использования LLM-роутера в пользу прямой интеграции с конкретными моделями.
- Основными причинами отказа стали рост задержек, сложность поддержки инфраструктуры и непредсказуемость ответов при смене моделей.
- Анализ показал, что экономия на стоимости токенов при использовании роутера не покрывает операционные расходы на его обслуживание.
- Унификация модели упрощает процесс тестирования и внедрения метрик качества (evals) в рабочие процессы.
- Современный тренд показывает, что стабильность и простота архитектуры становятся приоритетнее микрооптимизации затрат на инференс.