Разработчики представили open-source решение для записи и анализа видеоконференций, работающее полностью локально. Система использует мультимодальные возможности моделей для обработки аудио и визуального потока в реальном времени, обеспечивая конфиденциальность данных. Инструмент позволяет автоматизировать создание протоколов встреч и извлечение ключевых задач без передачи информации на внешние серверы сторонних облачных провайдеров.
Проект ориентирован на пользователей, которые работают с чувствительной корпоративной информацией и нуждаются в приватной альтернативе облачным сервисам транскрибации. Архитектура решения опирается на локальный инференс, что исключает зависимость от API-ключей и внешних ограничений по количеству запросов. Пользователи могут интегрировать систему в свои рабочие процессы для автоматического ведения заметок и структурирования обсуждений.
Техническая реализация включает конвейер обработки данных, который захватывает экран и звук, передавая их в локально развернутую модель для анализа контекста. Это позволяет системе не только распознавать речь, но и «видеть» происходящее на экране, например, демонстрируемые презентации или графики, что значительно повышает качество итоговых резюме по сравнению с чисто аудио-ориентированными сервисами.
Ключевые факты
- Полностью локальная обработка данных без отправки аудио или видео на внешние серверы.
- Поддержка мультимодального анализа: система одновременно обрабатывает звуковую дорожку и визуальный контент с экрана.
- Использование open-source моделей для транскрибации и суммаризации встреч.
- Отсутствие необходимости в подписках и API-ключах для работы с ИИ-функциями.
- Ориентация на обеспечение приватности при автоматизации ведения протоколов совещаний.