Разработчик представил инструмент Qarinah, позволяющий сократить затраты на использование API Claude и других моделей до 90%. Решение базируется на интеллектуальном кэшировании запросов и ответов, что исключает повторную оплату идентичных или семантически близких обращений к LLM, значительно снижая общий счет за инференс в агентных системах.

Система работает как прокси-сервер, который перехватывает запросы к API и проверяет наличие готового ответа в локальном хранилище. Использование векторного поиска позволяет находить релевантные ответы даже при небольших вариациях в промптах, что особенно эффективно в задачах разработки кода и чат-ботов, где многие запросы дублируются или имеют схожую структуру.

Помимо экономии, инструмент предоставляет инструменты для мониторинга потребления токенов и управления лимитами. Это позволяет разработчикам агентных систем контролировать расходы в реальном времени и оптимизировать архитектуру вызовов, не жертвуя качеством ответов моделей.

Ключевые факты

  • Qarinah обеспечивает снижение затрат на API-запросы до 90% за счет кэширования.
  • Инструмент поддерживает семантический поиск для выявления похожих запросов, а не только точных совпадений.
  • Реализован функционал прокси-сервера для прозрачной интеграции с существующими агентными пайплайнами.
  • Решение ориентировано на минимизацию избыточных вызовов к дорогостоящим моделям вроде Claude и Codex.