Исследователи представили PyroDash — фреймворк для совместного инференса малых (SLM) и больших (LLM) языковых моделей на уровне токенов. Система использует SLM как основной движок, который динамически запрашивает помощь LLM только для сложных фрагментов текста через специальные контрольные токены. Такой подход позволяет значительно снизить затраты на вычислительные ресурсы, сохраняя при этом высокую точность генерации, характерную для крупных моделей.
Архитектура PyroDash решает проблему избыточных затрат при использовании мощных моделей для простых задач. В процессе генерации SLM анализирует контекст и принимает решение о необходимости привлечения LLM. Если модель определяет, что текущий токен требует глубокого рассуждения, система переключается на более мощный ресурс. Это позволяет оптимизировать задержку и стоимость обслуживания, избегая неоправданного использования дорогих API или GPU-кластеров для рутинных операций.
Метод опирается на обучение SLM распознаванию моментов, когда её собственных способностей недостаточно для корректного продолжения последовательности. Интеграция такого механизма в производственные пайплайны позволяет гибко балансировать между качеством ответов и операционными расходами, что критически важно для масштабируемых агентных систем и сервисов с высокой нагрузкой.
Ключевые факты
- PyroDash реализует динамическое переключение между SLM и LLM на уровне генерации отдельных токенов.
- SLM выступает в роли «контроллера», который генерирует специальный токен для активации помощи со стороны более крупной модели.
- Фреймворк направлен на снижение общей стоимости инференса при сохранении качества ответов на уровне полноценных LLM.
- Метод позволяет сократить количество вычислительных операций, необходимых для обработки сложных запросов, за счет делегирования простых задач более легким моделям.