STT-MCP — это новый сервер для протокола Model Context Protocol (MCP), который позволяет ИИ-агентам локально преобразовывать аудио в текст. Решение обеспечивает приватную обработку голосовых команд без необходимости отправки данных во внешние облачные API, что критически важно для систем, работающих с конфиденциальной информацией или требующих минимальной задержки при взаимодействии с пользователем.

Инструмент интегрируется в любую агентную среду, поддерживающую стандарт MCP, позволяя моделям напрямую «слышать» и обрабатывать аудиопотоки. Использование локальных моделей для транскрибации исключает зависимость от сторонних сервисов, таких как OpenAI Whisper API или Google Cloud Speech-to-Text, и позволяет развернуть полноценный голосовой интерфейс в закрытом контуре инфраструктуры.

Реализация ориентирована на разработчиков, создающих автономных агентов с поддержкой мультимодального ввода. Проект предоставляет унифицированный интерфейс для подключения различных движков распознавания речи, что упрощает масштабирование и замену моделей без изменения логики работы самого агента.

Ключевые факты

  • STT-MCP использует протокол Model Context Protocol для стандартизированного взаимодействия с ИИ-агентами.
  • Обработка аудио происходит полностью локально, что гарантирует приватность данных и отсутствие затрат на API-вызовы.
  • Решение позволяет агентам получать текстовую расшифровку аудио в режиме реального времени.
  • Проект доступен в виде open-source реализации на GitHub для интеграции в существующие агентные пайплайны.