WorldBuild Bench — это новый инструмент для оценки способности больших языковых моделей поддерживать внутреннюю логику и пространственную связность при описании виртуальных миров. Проект использует 3D-игры как среду для тестирования, проверяя, насколько точно модель понимает архитектуру пространства, расположение объектов и причинно-следственные связи в динамической среде, что критически важно для создания сложных ИИ-агентов.
Традиционные бенчмарки часто фокусируются на текстовых задачах или кодинге, однако для полноценных автономных агентов, взаимодействующих с физическим или виртуальным миром, требуется глубокое понимание «мироустройства». WorldBuild Bench предлагает стандартизированный подход, где модель должна не просто генерировать текст, а демонстрировать понимание геометрии и логики игрового окружения, что позволяет выявить пробелы в «мировоззрении» текущих LLM.
Использование игровых движков в качестве полигона для тестирования позволяет автоматизировать проверку ответов модели. Вместо субъективной оценки экспертов система сопоставляет описание модели с реальными координатами и состоянием объектов в 3D-среде. Это дает возможность количественно измерить, насколько хорошо модель справляется с задачами навигации, описания сцен и удержания контекста в условиях меняющегося окружения.
Ключевые факты
- Бенчмарк использует 3D-игры для верификации пространственных и логических рассуждений нейросетей.
- Инструментарий позволяет автоматизировать оценку точности описания объектов и их взаиморасположения.
- Проект направлен на решение проблемы «галлюцинаций» в контексте пространственного моделирования.
- Репозиторий открыт для сообщества и включает готовые сценарии для тестирования различных моделей.