Исследователи представили ReToken — обучаемый эмбеддинг, который повышает эффективность работы Vision-Language моделей при обработке длинного визуального контекста. Метод позволяет модели выбирать только релевантные визуальные токены из кэша, решая проблему деградации производительности при наличии большого количества отвлекающих факторов и снижая вычислительную нагрузку на GPU при работе с объемными данными.

Традиционные подходы к обработке визуальной информации часто сталкиваются с ограничениями памяти при попытке проанализировать все токены изображения одновременно. ReToken выступает в роли целевого объекта для поиска, который динамически фильтрует визуальный контент, оставляя лишь наиболее значимые фрагменты. Это позволяет моделям сохранять высокую точность распознавания и поиска даже в условиях перегруженного визуального контекста.

Технология ориентирована на оптимизацию архитектур, работающих с визуальными базами данных и сложными сценами. Использование разреженного набора токенов вместо полной обработки всего кэша KV (Key-Value) значительно сокращает требования к видеопамяти, что делает возможным внедрение продвинутых мультимодальных систем в сценарии с ограниченными аппаратными ресурсами.

Ключевые факты

  • ReToken использует один обучаемый эмбеддинг для селективного извлечения визуальных токенов.
  • Метод направлен на решение проблемы деградации качества при росте числа визуальных дистракторов.
  • Технология позволяет эффективно работать с предварительно заполненным визуальным KV-кэшем.
  • Подход снижает вычислительные затраты, исключая необходимость обработки всех токенов изображения одновременно.