Компания Neon представила архитектуру Castform, которая позволяет превзойти проприетарные модели в задачах поиска и извлечения данных (RAG) при снижении затрат в 100 раз. Используя комбинацию открытых моделей и специализированных методов индексации, разработчики добились высокой точности ответов, сохранив при этом полную автономность инфраструктуры и значительную экономию вычислительных ресурсов по сравнению с использованием API закрытых систем.
Основная проблема большинства RAG-систем заключается в избыточном потреблении токенов и высокой задержке при работе с крупными языковыми моделями (LLM). В Neon пересмотрели подход к обработке контекста, внедрив оптимизированные пайплайны, которые фильтруют релевантную информацию до того, как она попадет в основную модель. Это позволяет использовать компактные и эффективные open-source решения, которые справляются с поиском по документации эффективнее, чем универсальные модели общего назначения.
Переход на собственную инфраструктуру позволил компании не только сократить расходы, но и повысить предсказуемость работы системы. В отличие от облачных API, где качество ответов может меняться после обновлений моделей, Castform обеспечивает стабильность за счет жесткого контроля над весами используемых нейросетей и методами векторизации данных. Такой подход доказывает, что для узкоспециализированных корпоративных задач локально развернутые модели могут быть эффективнее и дешевле рыночных лидеров.
Ключевые факты
- Архитектура Castform позволила снизить стоимость инференса в 100 раз по сравнению с использованием frontier-моделей.
- Система демонстрирует более высокую точность в задачах retrieval-augmented generation (RAG) на специфических технических данных.
- Решение базируется на открытых моделях, что исключает зависимость от обновлений API сторонних провайдеров.
- Оптимизация пайплайна позволила значительно сократить количество токенов, передаваемых в контекстное окно LLM, без потери качества ответов.