Исследователи представили OSReward — стандартизированный фреймворк для оценки моделей вознаграждения (reward models) в задачах компьютерного управления. Система автоматизирует верификацию действий ИИ-агентов, анализируя их траектории, состояние системы и логику выполнения инструкций. Это решение устраняет зависимость от ручной разметки, позволяя масштабировать обучение и оценку агентов, взаимодействующих с операционными системами и кросс-платформенными интерфейсами.
Развитие агентов, способных управлять компьютером (Computer-Using Agents, CUA), требует точных механизмов проверки того, насколько успешно модель справилась с поставленной задачей. Ранее для этого использовали либо человеческую оценку, которая не поддается масштабированию, либо простые скрипты, не учитывающие контекст и логику действий. OSReward предлагает более гибкий подход, который оценивает не только финальный результат, но и промежуточные шаги агента в реальной цифровой среде.
Внедрение подобных стандартизированных метрик критически важно для обучения с подкреплением (RL). Автоматизированная верификация позволяет быстрее итеративно улучшать модели, создавая более надежные петли обратной связи. Это приближает индустрию к созданию универсальных агентов, способных выполнять сложные многошаговые задачи в различных программных средах без постоянного контроля со стороны человека.
Ключевые факты
- OSReward автоматизирует процесс верификации действий агентов, заменяя трудоемкую ручную разметку.
- Фреймворк оценивает траектории агентов, включая их действия, изменения состояний системы и цепочки рассуждений.
- Система предназначена для улучшения обучения с подкреплением (RL) и повышения качества данных для тренировки моделей управления компьютером.
- Решение направлено на решение проблемы масштабируемости оценки в задачах, где требуется кросс-платформенное взаимодействие.