Исследователи представили механизм Latent Reward Registers, решающий проблему неэффективного обучения диффузионных моделей на основе человеческих предпочтений. Вместо оценки только финального результата, система анализирует промежуточные состояния процесса шумоподавления с помощью обучаемых регистров. Это позволяет модели точнее распределять «кредит» за качество на каждом этапе генерации, значительно повышая соответствие итогового контента заданным критериям.

Традиционные методы настройки диффузионных моделей часто опираются на разреженную обратную связь, которая оценивает лишь готовое изображение или видео. Такой подход затрудняет понимание того, на каком именно этапе генерации были допущены ошибки. Предложенный механизм встраивает обучаемые регистры непосредственно в латентное пространство, что дает модели возможность предсказывать финальную оценку предпочтений на ранних стадиях процесса.

Использование промежуточных сигналов вознаграждения позволяет избежать накопления ошибок в многошаговом процессе denoising. Это делает процесс обучения более стабильным и эффективным, сокращая потребность в огромных массивах размеченных данных. Метод демонстрирует потенциал для улучшения качества генерации в задачах, где критически важна тонкая настройка под субъективные предпочтения пользователей.

Ключевые факты

  • Механизм Latent Reward Registers оценивает предпочтения на промежуточных этапах шумоподавления.
  • Внедрение обучаемых регистров решает проблему «кредитного распределения» (credit assignment) в многошаговых диффузионных процессах.
  • Метод позволяет модели прогнозировать финальный результат до завершения всех итераций генерации.
  • Подход снижает зависимость от разреженных сигналов вознаграждения, которые обычно применяются только к финальным сэмплам.