Компания Neon представила архитектуру Castform, которая позволяет превзойти проприетарные модели в задачах поиска и извлечения данных (RAG) при снижении затрат в 100 раз. Используя комбинацию открытых моделей и специализированных методов индексации, разработчики добились высокой точности ответов, сохранив при этом полную автономность инфраструктуры и значительную экономию вычислительных ресурсов по сравнению с использованием API закрытых систем.

Основная проблема большинства RAG-систем заключается в избыточном потреблении токенов и высокой задержке при работе с крупными языковыми моделями (LLM). В Neon пересмотрели подход к обработке контекста, внедрив оптимизированные пайплайны, которые фильтруют релевантную информацию до того, как она попадет в основную модель. Это позволяет использовать компактные и эффективные open-source решения, которые справляются с поиском по документации эффективнее, чем универсальные модели общего назначения.

Переход на собственную инфраструктуру позволил компании не только сократить расходы, но и повысить предсказуемость работы системы. В отличие от облачных API, где качество ответов может меняться после обновлений моделей, Castform обеспечивает стабильность за счет жесткого контроля над весами используемых нейросетей и методами векторизации данных. Такой подход доказывает, что для узкоспециализированных корпоративных задач локально развернутые модели могут быть эффективнее и дешевле рыночных лидеров.

Ключевые факты

  • Архитектура Castform позволила снизить стоимость инференса в 100 раз по сравнению с использованием frontier-моделей.
  • Система демонстрирует более высокую точность в задачах retrieval-augmented generation (RAG) на специфических технических данных.
  • Решение базируется на открытых моделях, что исключает зависимость от обновлений API сторонних провайдеров.
  • Оптимизация пайплайна позволила значительно сократить количество токенов, передаваемых в контекстное окно LLM, без потери качества ответов.