Компания Waymo объявила о внедрении мультимодальных моделей Google Gemini в свою платформу Ojai, предназначенную для взаимодействия с пассажирами беспилотных такси. Новое решение позволяет пользователям получать контекстную информацию о маршруте, достопримечательностях и статусе поездки в режиме реального времени, используя естественный язык для общения с бортовым ИИ-ассистентом во время движения.

Интеграция Gemini направлена на улучшение пользовательского опыта за счет более глубокого понимания окружающей обстановки и предпочтений пассажиров. Система способна анализировать визуальные данные с камер автомобиля и сопоставлять их с геоданными, предоставляя персонализированные рекомендации или пояснения по ходу следования. Это превращает салон беспилотника из простого средства передвижения в интерактивное пространство, где ИИ выступает в роли информированного гида.

Технологический стек базируется на возможностях обработки видео и аудио в реальном времени, что критически важно для безопасности и комфорта в автономном транспорте. Разработка подчеркивает тренд на использование крупных языковых моделей для создания интеллектуальных интерфейсов в автомобильной индустрии, где ИИ берет на себя функции навигационного сопровождения и клиентского сервиса без участия водителя.

Ключевые факты

  • Waymo использует мультимодальные возможности Gemini для анализа визуального потока и текстового взаимодействия с пассажирами.
  • Система Ojai обеспечивает персонализированный контент, адаптированный под текущий маршрут и локацию автомобиля.
  • Внедрение ИИ направлено на повышение уровня комфорта и информированности пользователей в беспилотных такси.
  • Технология позволяет пассажирам задавать уточняющие вопросы о поездке и получать ответы, основанные на данных датчиков и карт в реальном времени.