Исследователи представили HIVE — инструмент для анализа того, как различные способы ввода (текст против голоса) влияют на точность работы LLM. Работа демонстрирует, что каждый канал передачи данных привносит специфические искажения: опечатки при наборе текста и ошибки распознавания речи или лингвистические неточности при диктовке, что существенно меняет качество ответов моделей в агентных сценариях.
Авторы работы проанализировали, как «шум» в человеческом вводе трансформируется в системные ошибки при обработке запросов. Текстовый ввод страдает от орфографических погрешностей, тогда как голосовой ввод, проходящий через системы транскрипции, сталкивается с проблемами дизфлюентности — отсутствием плавности речи и искажениями, возникающими при автоматическом преобразовании звука в текст. Исследование показывает, что современные модели по-разному реагируют на эти типы помех, что критически важно учитывать при проектировании интерфейсов для взаимодействия с ИИ.
Использование HIVE позволяет разработчикам тестировать устойчивость своих систем к вариативности человеческого ввода. Это помогает лучше понять, насколько надежно агент справляется с неидеальными данными, поступающими от пользователей в реальных условиях. Полученные результаты подчеркивают необходимость адаптации моделей не только к чистому тексту, но и к специфическим артефактам, возникающим при использовании голосовых помощников и инструментов диктовки.
Ключевые факты
- HIVE (Human Input-Variation Engine) — специализированный набор инструментов для генерации вариаций голосового и текстового ввода.
- Исследование выявило, что ошибки транскрипции и речевые особенности (дизфлюентность) создают уникальные паттерны искажений, отличные от классических опечаток.
- Работа подтверждает, что способ ввода напрямую влияет на способность LLM-агентов следовать инструкциям и выполнять сложные задачи.
- Методология позволяет количественно оценить падение производительности моделей при переходе от идеальных текстовых промптов к «зашумленным» данным реальных пользователей.