Исследователи представили SceneActBench — специализированный бенчмарк для оценки способности мультимодальных агентов взаимодействовать с комплексными 3D-сценами. В отличие от существующих тестов, фокусирующихся на описании объектов или простых манипуляциях, этот инструмент проверяет эффективность агентов в выполнении последовательных действий в полноценной 3D-среде, объединяя визуальное восприятие и управление объектами в единый рабочий цикл.

Современные модели часто ограничиваются текстовыми ответами или работой с одиночными объектами, что не отражает реальных потребностей при создании автономных систем для робототехники или виртуальных симуляций. SceneActBench предлагает унифицированную среду, где агент получает визуальные данные в формате PNG и должен совершить серию целевых действий, учитывая пространственные связи между множеством объектов в сцене.

Разработка направлена на устранение разрыва между способностью модели «видеть» и её умением совершать осмысленные физические или логические манипуляции в пространстве. Тестирование охватывает пять различных типов задач, требующих от агента не только распознавания контекста, но и планирования последовательности шагов для достижения результата в динамически меняющемся 3D-окружении.

Ключевые факты

  • SceneActBench оценивает агентов по пяти различным 3D-задачам в рамках единого цикла «агент-среда».
  • Входными данными для моделей служат изображения в формате PNG, на основе которых агент принимает решения о дальнейших действиях.
  • Бенчмарк фокусируется на многообъектных сценах, что значительно сложнее существующих тестов с одиночными объектами.
  • Основная цель проекта — переход от простого описания визуального контента к активному взаимодействию с 3D-пространством.