Исследователи представили концепцию Spoken Function Calling, которая позволяет напрямую связывать аудиосигналы с вызовом функций в ИИ-агентах. В отличие от классических систем, требующих промежуточной транскрипции текста, этот метод использует аудио-языковые модели для прямого извлечения семантики и выполнения задач, что значительно снижает задержки и повышает точность обработки естественной речи в реальном времени.

Традиционные системы понимания разговорной речи (SLU) часто сталкиваются с трудностями при работе с открытыми доменами, так как зависят от предварительного обучения на узкоспециализированных наборах данных. Новый подход переносит логику обработки непосредственно в архитектуру аудио-языковых моделей, позволяя агентам интерпретировать голосовые команды как инструкции для вызова API без необходимости перевода в текстовый формат.

Такая архитектура открывает возможности для создания более отзывчивых голосовых интерфейсов, способных эффективно работать в условиях многозадачности. Использование аудио-ориентированного подхода минимизирует ошибки, возникающие при автоматическом распознавании речи (ASR), и позволяет агентам лучше улавливать интонационные нюансы и контекст, критически важные для выполнения сложных пользовательских запросов.

Ключевые факты

  • Метод исключает этап транскрипции (ASR), снижая общую задержку системы и вероятность ошибок распознавания.
  • Технология ориентирована на использование аудио-языковых моделей для выполнения задач в открытых доменах.
  • Подход улучшает возможности In-Context Learning, позволяя агентам адаптироваться к новым функциям без дообучения.
  • Решение направлено на создание бесшовного взаимодействия между человеком и агентом в рамках диалоговых систем.