Исследователи представили MonoVoc — метод для создания 3D-сцен с поддержкой семантического поиска по естественному языку на основе монокулярных данных. Решение разделяет геометрические и семантические признаки, что позволяет значительно снизить требования к памяти и вычислительным ресурсам при работе с 3D-гауссианами, устраняя необходимость в сложных многоракурсных съемках и длительной оптимизации под конкретные сцены.
Традиционные подходы к 3D-реконструкции с открытым словарем часто сталкиваются с проблемой избыточного потребления памяти из-за хранения плотных языковых признаков для каждой точки пространства. MonoVoc решает эту задачу через декомпозицию: геометрия сцены обрабатывается отдельно от семантического описания. Это позволяет системе эффективно масштабироваться и работать с более легкими моделями, сохраняя при этом высокую точность интерпретации объектов в 3D-пространстве.
Технология открывает новые возможности для интерактивных систем, где пользователю необходимо взаимодействовать с виртуальной или дополненной средой с помощью текстовых запросов. Благодаря снижению нагрузки на аппаратное обеспечение, подобные системы становятся пригодными для использования в мобильных устройствах и приложениях реального времени, где критически важна скорость обработки данных и компактность представления 3D-объектов.
Ключевые факты
- Метод MonoVoc разделяет геометрические данные и семантическую информацию для оптимизации 3D-гауссианов.
- Архитектура позволяет выполнять реконструкцию сцен на основе монокулярных изображений, исключая необходимость в многоракурсной съемке.
- Новый подход существенно снижает требования к объему памяти, необходимому для хранения языковых признаков в 3D-пространстве.
- Решение ориентировано на создание интерактивных систем с поддержкой запросов на естественном языке для навигации в реконструированных средах.