Исследователи представили метод дистилляции сложных навыков логического вывода из закрытых моделей в компактные open-source агенты, специализирующиеся на поиске информации. Новый подход позволяет переносить способности к многошаговому планированию и анализу данных, сохраняя при этом высокую производительность при значительно меньших вычислительных затратах, что делает продвинутые агентные системы доступными для локального запуска и интеграции в прикладные решения.
Основная проблема текущих агентных систем заключается в зависимости от тяжелых API-моделей, которые требуют значительных затрат на инференс и не всегда подходят для задач с жесткими требованиями к приватности. Предложенная методика обучения фокусируется на передаче паттернов «рассуждения» (reasoning traces), которые модель-учитель генерирует в процессе поиска и фильтрации данных, в архитектуру легковесных моделей-студентов.
В ходе экспериментов авторы продемонстрировали, что дистиллированные агенты показывают сопоставимую с GPT-4 точность в задачах поиска и синтеза ответов на основе внешних источников. Это открывает путь к созданию эффективных RAG-систем, которые способны самостоятельно строить цепочки запросов к поисковым индексам и критически оценивать релевантность найденных документов без обращения к облачным провайдерам.
Ключевые факты
- Метод основан на переносе цепочек рассуждений (Chain-of-Thought) от проприетарных моделей к специализированным open-source агентам.
- Дистиллированные модели демонстрируют снижение задержки (latency) при выполнении поисковых запросов на 40% по сравнению с исходными моделями.
- Архитектура агента оптимизирована для работы с внешними поисковыми API и локальными векторными базами данных.
- Исследование подтверждает возможность достижения высокой точности в задачах извлечения фактов при использовании моделей с количеством параметров менее 10 миллиардов.