Исследователи представили архитектуру Matryoshka, позволяющую обучать набор языковых моделей разного размера как единую вложенную структуру. Такой подход значительно повышает эффективность обучения и инференса, сокращая общее количество параметров в наборе. Модели меньшего размера извлекаются из основной архитектуры, что упрощает дистилляцию знаний и оптимизирует развертывание систем с динамическими требованиями к вычислительным ресурсам.
Традиционный процесс создания линейки моделей требует независимого обучения и поддержки каждой версии, что влечет за собой высокие затраты на инфраструктуру и хранение весов. Метод Matryoshka решает эту проблему за счет «матрешечной» организации слоев: одна большая модель содержит в себе несколько более компактных подмоделей, которые могут работать независимо друг от друга.
Данная технология позволяет гибко переключаться между моделями разной мощности в рамках одного процесса развертывания. Это критически важно для сценариев, где требуется адаптация под доступные аппаратные мощности или ограничение задержек (latency) без необходимости держать в памяти несколько отдельных полновесных нейросетей.
Ключевые факты
- Архитектура объединяет несколько моделей разного размера в единый обучаемый стек.
- Метод снижает суммарное количество параметров, необходимых для обслуживания всей линейки моделей.
- Реализована возможность эффективной дистилляции знаний от самой крупной модели ко всем остальным внутри стека.
- Подход оптимизирует использование памяти при инференсе за счет возможности выбора подмодели нужного размера из общего архитектурного каркаса.