Исследователи представили метод Appearance Pointers, позволяющий добиться высокой точности при генерации изображений с помощью Diffusion Transformers (DiT). Технология решает проблему ограниченного контроля текстовых промптов, внедряя механизм указателей для локального управления объектами, материалами и пространственным расположением элементов. Это позволяет пользователям задавать конкретные визуальные атрибуты для отдельных областей кадра без потери общей целостности композиции.
Традиционные модели на базе трансформеров успешно обрабатывают мультимодальные данные, однако им не хватало инструментов для точной привязки визуальных признаков к конкретным регионам изображения. Новый подход использует механизм «указателей», который связывает специфические визуальные токены с пространственными координатами. В результате модель способна переносить текстуры или идентичность объектов из референсных изображений в строго заданные зоны, сохраняя при этом естественность генерации.
Метод демонстрирует значительное преимущество перед стандартными методами инпейнтинга или маскирования, так как не требует предварительной сегментации или сложной подготовки данных. Это открывает новые возможности для профессиональных инструментов редактирования, где требуется предсказуемый результат при работе с визуальными активами, будь то изменение материала конкретного объекта или перенос стиля на заданный фрагмент сцены.
Ключевые факты
- Метод Appearance Pointers обеспечивает региональный контроль в моделях архитектуры Diffusion Transformers.
- Технология позволяет передавать идентичность объектов и свойства материалов через визуальные указатели.
- Решение устраняет зависимость от текстовых описаний при необходимости точного пространственного позиционирования.
- Метод интегрируется в нативную архитектуру DiT, используя гетерогенные токены для обработки текста и изображений одновременно.