Для эффективной работы ИИ-агентов предложен архитектурный паттерн, разделяющий память на два уровня: постоянное хранилище (Persistent Memory) и производный контекст (Derived Context). Такой подход позволяет агентам сохранять долгосрочные знания о пользователе или задаче, одновременно формируя динамический контекст для текущей сессии, что значительно повышает точность ответов и снижает избыточность передаваемых данных.

Постоянная память выступает в роли базы знаний, где хранятся структурированные факты, предпочтения и история взаимодействий. В свою очередь, производный контекст представляет собой «рабочую область», куда извлекается только релевантная информация из постоянного хранилища в зависимости от текущего запроса. Это разделение решает проблему ограниченного контекстного окна LLM и предотвращает «галлюцинации», вызванные перегрузкой модели неактуальными данными.

Использование такой архитектуры позволяет разработчикам оптимизировать затраты на токены и улучшить предсказуемость поведения агентов. Вместо того чтобы скармливать модели всю историю переписки, система выполняет семантический поиск по постоянной базе и формирует сжатый, сфокусированный контекст, который подается на вход модели в реальном времени.

Ключевые факты

  • Паттерн разделяет память на долгосрочное хранилище (Persistent Memory) и динамический рабочий контекст (Derived Context).
  • Метод минимизирует потребление токенов за счет передачи в модель только извлеченных релевантных данных, а не всей истории.
  • Архитектура снижает вероятность ошибок модели, обеспечивая четкое разграничение между статичными знаниями и текущей задачей.
  • Подход применим для создания масштабируемых агентных систем, требующих персонализации и длительного удержания контекста взаимодействия.