Опубликованы результаты сравнительного тестирования популярных LLM-шлюзов, оценивающие скорость отклика (Time To First Token, TTFT) при работе с моделью Claude 3.5 Haiku. Исследование охватывает 150 прогонов запросов через LLM Gateway, OpenRouter и Vercel AI SDK, выявляя различия в задержках, которые критически влияют на пользовательский опыт в агентных системах и чат-интерфейсах.

Бенчмарк фокусируется на стабильности и скорости доставки первого токена, что является ключевым показателем для приложений, требующих высокой отзывчивости. Результаты показывают, как архитектурные особенности каждого шлюза влияют на общую производительность при обращении к API провайдеров. Авторы анализируют, насколько эффективно каждый сервис справляется с маршрутизацией запросов и минимизацией накладных расходов на инфраструктурном уровне.

Данные подчеркивают важность выбора промежуточного слоя при построении масштабируемых систем на базе LLM. Разница в миллисекундах при TTFT может стать решающим фактором для real-time приложений, где задержка в ответе модели напрямую коррелирует с качеством взаимодействия пользователя с ИИ-агентом.

Ключевые факты

  • Тестирование проводилось на 150 итерациях запросов для каждой платформы.
  • В качестве целевой модели использовалась Claude 3.5 Haiku.
  • Сравнивались три инфраструктурных решения: LLM Gateway, OpenRouter и Vercel AI SDK.
  • Основной метрикой исследования стал TTFT (Time To First Token), определяющий скорость начала генерации ответа.
  • Результаты демонстрируют вариативность задержек в зависимости от выбранного метода маршрутизации и проксирования API-запросов.