Разработчики представили open-source решение для записи и анализа видеоконференций, работающее полностью локально. Система использует мультимодальные возможности моделей для обработки аудио и визуального потока в реальном времени, обеспечивая конфиденциальность данных. Инструмент позволяет автоматизировать создание протоколов встреч и извлечение ключевых задач без передачи информации на внешние серверы сторонних облачных провайдеров.

Проект ориентирован на пользователей, которые работают с чувствительной корпоративной информацией и нуждаются в приватной альтернативе облачным сервисам транскрибации. Архитектура решения опирается на локальный инференс, что исключает зависимость от API-ключей и внешних ограничений по количеству запросов. Пользователи могут интегрировать систему в свои рабочие процессы для автоматического ведения заметок и структурирования обсуждений.

Техническая реализация включает конвейер обработки данных, который захватывает экран и звук, передавая их в локально развернутую модель для анализа контекста. Это позволяет системе не только распознавать речь, но и «видеть» происходящее на экране, например, демонстрируемые презентации или графики, что значительно повышает качество итоговых резюме по сравнению с чисто аудио-ориентированными сервисами.

Ключевые факты

  • Полностью локальная обработка данных без отправки аудио или видео на внешние серверы.
  • Поддержка мультимодального анализа: система одновременно обрабатывает звуковую дорожку и визуальный контент с экрана.
  • Использование open-source моделей для транскрибации и суммаризации встреч.
  • Отсутствие необходимости в подписках и API-ключах для работы с ИИ-функциями.
  • Ориентация на обеспечение приватности при автоматизации ведения протоколов совещаний.