Компания Induction Labs анонсировала Photon-1 — фундаментальную модель, способную обучаться на «сырых» видеоданных без использования меток действий. Архитектура модели, основанная на принципе Mixture-of-Experts, позволяет предсказывать динамику систем, включая работу с интерфейсами рабочего стола и физические процессы, опираясь исключительно на визуальный ряд. Это решение устраняет необходимость в разметке действий, которая ранее выступала главным ограничением для обучения агентных моделей.

Традиционные подходы к обучению агентов на видео требовали точного сопоставления каждого кадра с конкретным действием, что существенно сужало возможности масштабирования. Photon-1 использует подход «моделей воображения» (imagination models), обучаясь предсказывать будущие состояния среды на основе предыдущих визуальных последовательностей. В ходе тестов модель продемонстрировала способность моделировать поведение компьютерных интерфейсов, играть в шашки и просчитывать траектории движения бильярдных шаров.

Техническая реализация Photon-1 базируется на разреженной архитектуре MoE, что позволяет эффективно управлять вычислительными ресурсами при сохранении высокой емкости знаний. Отказ от привязки к действиям (action-agnostic pretraining) открывает путь к созданию универсальных агентов, способных обучаться в любых визуальных средах, где доступна только демонстрация процесса, без доступа к логам управления или метаданным.

Ключевые факты

  • Модель Photon-1 построена на архитектуре Mixture-of-Experts (MoE) с параметрами 106B-A5B.
  • Обучение проводится на неразмещенных видеоданных без указания действий, совершаемых в кадре.
  • Система успешно моделирует сложные среды: от взаимодействия с десктопными приложениями до физики бильярда.
  • Подход направлен на преодоление «бутылочного горлышка» в виде необходимости ручной или автоматической разметки действий для обучения ИИ-агентов.