Исследователи представили метод Addressable Memory, решающий проблему деградации визуальной памяти в интерактивных видео-моделях. При генерации длинных последовательностей стандартный KV-кэш перестает корректно считываться из-за выхода временных позиционных эмбеддингов (RoPE) за пределы обучающего диапазона. Новый подход позволяет моделям сохранять стабильность визуального контекста даже при генерации видео, значительно превышающих по длительности тренировочные данные.

Проблема «забывания» или потери доступа к ранним кадрам является критическим барьером для создания реалистичных симуляций и интерактивных сред. Когда модель выходит за рамки своего «тренировочного горизонта», накопленные данные в KV-кэше становятся недоступными для механизмов внимания из-за искажения позиционной информации. Предложенное решение переосмысливает способ индексации памяти, обеспечивая устойчивую работу модели при неограниченном расширении контекста.

Данное исследование открывает путь к созданию видео-моделей, способных поддерживать логическую и визуальную связность на протяжении длительных сессий. Это критически важно для развития автономных агентов, работающих в сложных визуальных средах, где требуется долгосрочное планирование и удержание состояния объектов в памяти без потери деталей при смене ракурсов или длительном взаимодействии.

Ключевые факты

  • Основная причина сбоев — выход временных RoPE-эмбеддингов за пределы диапазона, виденного при обучении.
  • Метод Addressable Memory позволяет эффективно адресовать содержимое KV-кэша даже при генерации видео, выходящих за рамки обучающего горизонта.
  • Исследование фокусируется на улучшении визуальной персистентности в интерактивных моделях мира.
  • Решение устраняет необходимость в постоянном переобучении моделей для поддержки длинных видео-последовательностей.