Память и RAG
Memoars: уровень зашифрованной памяти для ИИ-агентов
Memoars представляет собой инфраструктурное решение, обеспечивающее общий слой памяти для различных ИИ-ассистентов. Система позволяет агентам безопасно хранить, извлекать и обмениваться контекстом в зашифрованном виде. Это упрощает создание связных агентных систем, где разные модели могут обращаться к единой базе знаний пользователя, сохраняя приватность данных и обеспечивая непрерывность взаимодействия между сессиями.
Cloudflare представила AI Search для упрощения RAG-систем
Cloudflare запустила сервис AI Search, позволяющий разработчикам быстро создавать поисковые системы по собственным данным и веб-ресурсам без необходимости сложной настройки инфраструктуры. Решение автоматизирует процессы индексации и поиска, предоставляя готовый инструмент для интеграции с ИИ-агентами. Компания также анонсировала новую модель ценообразования, направленную на упрощение масштабирования агентных приложений и сервисов с поддержкой RAG.
Hanyan Cognitive Core: локальный слой памяти для ИИ-агентов
Hanyan Cognitive Core (HCC) — это инфраструктурное решение для организации памяти в агентных системах, ориентированное на локальное хранение данных. Система обеспечивает высокую эффективность извлечения контекста с показателем попадания в кэш (cache hit rate) на уровне 98%. Проект позиционируется как экономичный слой памяти, позволяющий оптимизировать затраты на работу агентов до 40 долларов в месяц.
Организация долгосрочной памяти для ИИ-агентов
Для создания полноценных ИИ-агентов необходимо обеспечить сохранение контекста между сессиями, так как стандартные LLM ограничены рамками одного диалога. Решение заключается в интеграции внешних хранилищ, которые позволяют агенту извлекать релевантную информацию из прошлых взаимодействий, обеспечивая персонализацию и непрерывность работы без необходимости переобучения модели или передачи огромных объемов данных в каждом запросе.
Обзор архитектур памяти для ИИ-агентов
Исследование текущего состояния агентной памяти систематизирует подходы к хранению и извлечению контекста для автономных систем. Основной фокус смещается от простых векторных баз данных к многоуровневым архитектурам, сочетающим кратковременную рабочую память, семантическое хранилище для долгосрочного опыта и структурированные графы знаний для обеспечения точности и последовательности действий агентов в сложных сценариях.
Amazon DynamoDB добавила встроенную поддержку векторного поиска
Amazon DynamoDB теперь поддерживает векторный поиск в реальном времени, позволяя хранить и искать векторные эмбеддинги непосредственно в базе данных. Это обновление устраняет необходимость в использовании отдельных специализированных векторных хранилищ для многих приложений, упрощая архитектуру RAG-систем и обеспечивая масштабируемость при работе с большими объемами данных в облачной инфраструктуре AWS.
TencentDB Agent Memory: решение для командной памяти ИИ-агентов
Tencent представила проект TencentDB Agent Memory — инфраструктурное решение для организации коллективной памяти ИИ-агентов. Система позволяет агентам обмениваться контекстом и накопленными данными в рамках командной работы, обеспечивая структурированное хранение и извлечение информации. Инструмент ориентирован на масштабируемые сценарии, где требуется согласованная работа нескольких автономных систем над общими задачами с использованием единой базы знаний.
Token-Native Storage: новый подход к хранению данных для ИИ-агентов
Исследователи представили концепцию Token-Native Storage — метод хранения данных, оптимизированный под работу LLM. В отличие от классических векторных БД, система оперирует непосредственно токенами, что позволяет агентам считывать и записывать информацию в «родном» для них формате. Это значительно сокращает задержки при извлечении контекста и повышает точность работы с долгосрочной памятью в агентных системах.
Иерархическая графовая память для улучшения долгосрочного планирования ИИ-агентов
Исследователи представили метод Hierarchical Graph Memory (HGM), решающий проблему накопления нерелевантной информации в долгосрочной памяти ИИ-агентов. В отличие от плоских графовых структур, HGM использует иерархическую организацию, позволяющую эффективно локализовать пути поиска и перезаписывать устаревшие данные, что значительно повышает точность многошаговых рассуждений при работе с большими объемами накопленного опыта.
Callosium: единая система памяти для ИИ-агентов на базе Markdown
Callosium представляет собой инфраструктурное решение для организации долгосрочной памяти ИИ-агентов, использующее обычные Markdown-файлы в качестве хранилища. Система позволяет разным моделям и агентам обмениваться контекстом и накопленными знаниями через унифицированный формат, упрощая интеграцию памяти в агентные пайплайны без необходимости развертывания сложных векторных баз данных на начальных этапах разработки.
Zero-Mem: новый метод управления памятью для ИИ-агентов без затрат токенов
Исследователи представили Zero-Mem — архитектурный подход, позволяющий ИИ-агентам выполнять операции с памятью без расходования контекстных токенов. Метод переносит управление данными на уровень внешних операций, исключая необходимость постоянной пересылки истории взаимодействий в промпт. Это радикально снижает задержки и стоимость инференса, сохраняя при этом способность агентов к долгосрочному запоминанию контекста и выполнению сложных задач.
Hubmesh: оптимизация RAG через многошаговый поиск без участия LLM
Hubmesh — это новый инструмент для организации многошагового поиска (multi-hop RAG), который позволяет извлекать контекст из сложных графовых структур данных без использования LLM на этапе запроса. Решение минимизирует задержки и снижает затраты на инференс, перенося логику навигации по связям между документами на уровень алгоритмической обработки графа.
Pixel-Native RAG: визуальный подход к индексации документов
Pixel-Native RAG — это подход к построению систем поиска, который отказывается от классического парсинга текста в пользу обработки документов как изображений. Система использует визуальное представление страниц, включая PDF и веб-контент, что позволяет сохранять структуру, верстку и графические элементы, которые часто теряются при стандартном извлечении текста, повышая точность поиска в сложных документах.
Stash: создание персональной базы знаний для ИИ-агентов на основе истории браузера
Проект Stash предлагает новый подход к формированию контекста для ИИ-агентов, превращая историю посещенных пользователем веб-страниц в структурированную базу знаний. Инструмент автоматически индексирует просмотренный контент, позволяя агентам обращаться к персональному «интернету» пользователя для выполнения задач, что значительно повышает релевантность ответов и глубину персонализации при работе с LLM.
Реверс-инжиниринг системы памяти ChatGPT
Исследователи провели детальный анализ того, как устроена функция памяти в ChatGPT. Изучение показало, что система работает не как классическая база данных, а через динамическое обновление контекста, где модель сама решает, какие факты из прошлых диалогов стоит сохранить, а какие — удалить, чтобы оптимизировать использование токенов и точность ответов.
Bourdon: единый файл памяти для ИИ-агентов и IDE
Bourdon представляет собой инструмент для синхронизации контекста между различными ИИ-инструментами, включая Claude Code, Codex и Cursor. Решение использует единый файл памяти, который позволяет агентам обмениваться накопленными данными и знаниями о проекте. Это устраняет необходимость дублировать инструкции и настройки для каждого отдельного ИИ-помощника, обеспечивая согласованность работы в разных средах разработки.
TARL: новый подход к управлению памятью для долгосрочных ИИ-агентов
Исследователи представили TARL (Transaction-Aware Reliable Ledgers) — фреймворк для управления памятью ИИ-агентов, решающий проблему искажения знаний при обновлении данных. В отличие от стандартных систем, работающих по принципу «записать или пропустить», TARL использует транзакционный подход, позволяющий агентам дифференцированно обрабатывать новую информацию: обновлять устаревшие убеждения, игнорировать шум или откладывать верификацию данных для повышения надежности долгосрочной памяти.
Проблема деградации памяти в ИИ-системах
Исследование выявило критическую уязвимость в системах долгосрочной памяти LLM: данные не только записываются с ошибками, но и подвержены «порче» в процессе эксплуатации. Со временем накопленная информация искажается из-за особенностей механизмов извлечения и контекстного окна, что приводит к деградации точности ответов агента даже при наличии корректных исходных данных в базе.
Метод PRECOG ускоряет RAG для SSM-моделей до константного времени
Исследователи представили метод PRECOG (Pre-Computed Context Injection), который радикально меняет работу RAG в моделях на базе State-Space Models (SSM). Технология позволяет сократить затраты на префилл с линейной зависимости от длины контекста до константного времени O(1). Это устраняет вычислительные задержки при извлечении данных, делая работу с большими корпусами документов на периферийных устройствах значительно эффективнее.
LiveMem: новый подход к сохранению состояния памяти в долгоживущих ИИ-агентах
Исследователи представили метод LiveMem, решающий проблему потери контекста при работе долгоживущих ИИ-агентов. В отличие от стандартных RAG-систем или суммаризации, LiveMem обеспечивает непрерывность состояния в течение всего жизненного цикла модели, позволяя агенту сохранять накопленный опыт даже при смене рабочих контекстов и переполнении окна внимания, что критически важно для сложных автономных задач.
Почему Markdown-вики эффективнее специализированных систем памяти для ИИ-агентов
Исследование Verging Labs показало, что простая иерархическая структура Markdown-файлов превосходит специализированные системы памяти для ИИ-агентов в задачах поиска и контекстуализации. В ходе бенчмаркинга выяснилось, что традиционные базы данных и векторные хранилища часто уступают по точности извлечения информации хорошо организованной текстовой документации, что ставит под сомнение необходимость усложнения архитектуры памяти.
RoMeRL: новый метод оптимизации памяти для самообучающихся ИИ-агентов
Исследователи представили метод RoMeRL, решающий проблему неэффективного обучения памяти у ИИ-агентов. Алгоритм использует состояния полезности пониженного порядка для борьбы с размытием обратной связи и ловушкой «память-награда». Это позволяет агентам точнее оценивать релевантность накопленного опыта, предотвращая ошибочное обновление полезности для неактуальных данных при работе с длинными историями взаимодействий.
Разбор внутренних механизмов работы RAG-пайплайнов
Статья детально описывает архитектурный цикл RAG-систем (Retrieval-Augmented Generation), прослеживая путь данных от индексации документов до генерации финального ответа. Автор анализирует критические этапы: предобработку текста, создание векторных представлений, стратегии поиска релевантных фрагментов и их интеграцию в контекстное окно LLM, подчеркивая влияние каждого шага на точность и качество итогового результата.
Исследование уязвимостей памяти ИИ-агентов к отравленным данным
Разработчик представил проект HOM-AIMOS, демонстрирующий уязвимость систем памяти ИИ-агентов к атакам типа «отравление данных». В отличие от стандартных систем, которые стремятся очищать контекст, этот подход намеренно сохраняет вредоносные данные в долгосрочной памяти агента. Это позволяет изучить механизмы манипуляции поведением моделей через внедрение специфических паттернов в их базу знаний.