Исследователи представили метод LEMUR, позволяющий обучать системы с подкреплением при наличии нескольких конфликтующих целей. В отличие от классических подходов, использующих единую скалярную функцию вознаграждения, LEMUR опирается на обратную связь от предпочтений пользователя. Это позволяет модели находить оптимальный баланс между противоречивыми задачами, такими как производительность и энергоэффективность, без необходимости ручного проектирования сложных функций вознаграждения.

Традиционные системы обучения с подкреплением часто сталкиваются с проблемой «узкого» вознаграждения, когда оптимизация одного параметра приводит к деградации других характеристик. В реальных сценариях, например, при управлении робототехникой или распределении ресурсов, требования часто меняются динамически. LEMUR решает эту задачу, обучая модель предсказывать предпочтения пользователя в многомерном пространстве целей, что делает процесс адаптации более гибким и приближенным к человеческим ожиданиям.

Метод демонстрирует высокую эффективность в задачах, где невозможно формализовать идеальный результат через одну метрику. Использование обратной связи от предпочтений позволяет системе обучаться в условиях неопределенности, когда ground-truth данные недоступны или слишком дороги для сбора. Это открывает возможности для более точной настройки сложных агентных систем, работающих в многозадачных средах.

Ключевые факты

  • LEMUR использует многоцелевое обучение с подкреплением (MORL) для балансировки конкурирующих метрик.
  • Метод заменяет жесткую скалярную функцию вознаграждения на динамическую модель предпочтений.
  • Подход позволяет оптимизировать системы по нескольким критериям одновременно, например, по скорости и затратам ресурсов.
  • Алгоритм эффективен в сценариях, где целевая функция не задана явно и требует человеческого участия для оценки результатов.