Проект Talkthrough позволяет превращать видеозаписи экрана с голосовыми комментариями в структурированные данные, пригодные для использования ИИ-агентами. Решение работает локально и распространяется под лицензией MIT, предлагая разработчикам способ быстрого создания контекста для агентных систем на основе пользовательских действий и пояснений, записанных в реальном времени.

Инструмент использует архитектуру MCP (Model Context Protocol), что обеспечивает стандартизированное взаимодействие между записанными данными и LLM. Пользователь записывает процесс выполнения задачи, сопровождая его речью, после чего система транскрибирует аудио и сопоставляет его с визуальным рядом. Полученный результат можно передать агенту в качестве обучающего примера или инструкции для автоматизации аналогичных процессов.

Такой подход решает проблему «холодного старта» при настройке агентов, когда требуется быстро передать системе алгоритм действий в сложном интерфейсе. Вместо написания формальных спецификаций или промптов разработчик может просто продемонстрировать последовательность шагов, которую агент затем сможет интерпретировать и воспроизвести в рамках своей рабочей среды.

Ключевые факты

  • Инструмент реализован как сервер для протокола MCP, обеспечивая совместимость с современными агентными фреймворками.
  • Обработка данных происходит полностью локально, что исключает передачу конфиденциальной информации на сторонние серверы.
  • Проект распространяется с открытым исходным кодом под лицензией MIT.
  • Основной сценарий использования — автоматизация рутинных задач через демонстрацию действий с последующей конвертацией в агентные инструкции.