Исследователи представили PRISM — фреймворк на базе flow-matching для перевода изображений без использования парных обучающих выборок. В отличие от диффузионных моделей, применяющих глобальные параметры шума, PRISM использует механизм распределенного управления (distribution-gated), позволяющий точечно разделять сохраняемый контент и изменяемые визуальные атрибуты, что значительно повышает точность и управляемость генерации в задачах unpaired image-to-image translation.
Традиционные подходы к переносу стиля или домена часто сталкиваются с проблемой «размытия» важных деталей объекта, так как глобальные направляющие сигналы не всегда способны отличить структуру от текстуры. PRISM решает эту задачу за счет интеграции специализированных гейтов, которые динамически определяют области изображения, подлежащие трансформации. Это позволяет модели сохранять исходную геометрию объектов, меняя только целевые характеристики, такие как освещение, стиль или погодные условия.
Метод исключает необходимость использования GAN-архитектур, что упрощает процесс обучения и повышает стабильность генерации. Использование flow-matching вместо классической диффузии сокращает количество итераций, необходимых для получения качественного результата, сохраняя при этом высокую детализацию выходных данных. Технология демонстрирует эффективность в задачах, где критически важно соблюдение баланса между креативной трансформацией и сохранением исходной структуры входного изображения.
Ключевые факты
- PRISM использует архитектуру flow-matching, полностью отказываясь от GAN-структур в задачах перевода изображений.
- Механизм distribution-gated позволяет разделять контент и стиль на уровне отдельных областей изображения, а не через глобальные параметры.
- Метод предназначен для обучения на непарных данных, что снимает необходимость в создании сложных размеченных датасетов.
- Технология обеспечивает более высокую степень контроля над сохранением структуры объекта по сравнению с традиционными диффузионными моделями.