Google DeepMind анонсировала Genie 3 — фундаментальную модель, способную генерировать интерактивные виртуальные миры на основе текстовых или визуальных промптов. В отличие от предшественников, система демонстрирует улучшенное понимание физики объектов и логики взаимодействия, позволяя пользователям управлять персонажами в созданных средах в режиме реального времени, что открывает новые возможности для симуляций и игровых движков.

Модель обучалась на огромных массивах видеоданных, что позволило ей освоить принципы динамики объектов без явного программирования физических законов. Genie 3 предсказывает следующие кадры в зависимости от действий пользователя, обеспечивая высокую степень консистентности и плавности визуального ряда. Технология ориентирована на создание сложных сред, где ИИ выступает не просто генератором контента, а активным участником симуляции.

Разработка представляет собой значительный шаг в области «мировых моделей» (world models), которые стремятся к глубокому моделированию реальности. Интеграция таких систем в творческие и инженерные процессы позволит автоматизировать создание прототипов виртуальных пространств, сокращая время на разработку сложных интерактивных сценариев и расширяя границы генеративного ИИ за пределы статичных изображений и видео.

Ключевые факты

  • Genie 3 способна генерировать интерактивные миры, реагирующие на действия пользователя в реальном времени.
  • Модель демонстрирует продвинутое понимание физических взаимодействий и динамики объектов в 2D и 3D-пространствах.
  • Система обучалась на обширных наборах видеоданных, что позволило ей выучить закономерности окружающего мира без использования традиционных физических движков.
  • Технология поддерживает генерацию контента на основе текстовых описаний и визуальных референсов, обеспечивая высокую степень контроля над создаваемой средой.