Исследователи изучили, способны ли предобученные аудиомодели улавливать биологические закономерности в звуках морских млекопитающих и птиц без специального обучения. Анализ показал, что эмбеддинги моделей AST, CLAP, BEATs-bio и BirdNET отражают филогенетическое расстояние между видами, что подтверждает наличие глубоких структурных знаний в векторных представлениях, сформированных при обучении на общих аудиоданных.
Эксперимент проверял гипотезу о том, что геометрия пространства эмбеддингов может соответствовать «древу жизни». Модели, обученные на широких наборах данных, демонстрируют способность классифицировать звуки по биологическому родству видов, даже если эта задача не ставилась при их создании. При этом использование узкоспециализированных данных для дообучения моделей дает лишь ограниченный прирост точности в подобных задачах.
Результаты работы указывают на то, что современные архитектуры аудиомоделей извлекают из звукового сигнала гораздо более сложные и фундаментальные признаки, чем просто идентификация конкретных объектов или событий. Это открывает новые возможности для использования ИИ в биоакустике и мониторинге биоразнообразия, где требуется классификация видов на основе их вокализаций в естественной среде.
Ключевые факты
- В исследовании протестированы четыре архитектуры: AST, CLAP, BEATs-bio и BirdNET.
- Модели успешно восстанавливали филогенетическое расстояние между видами, несмотря на отсутствие соответствующих меток в обучающих выборках.
- Дообучение на узкоспециализированных доменах показало минимальное преимущество по сравнению с использованием общих предобученных весов.
- Работа подтверждает, что аудиоэмбеддинги содержат скрытую информацию о биологической эволюции и родстве видов.