Исследователи представили архитектуру Matryoshka, позволяющую обучать набор языковых моделей разного размера как единую вложенную структуру. Такой подход значительно повышает эффективность обучения и инференса, сокращая общее количество параметров в наборе. Модели меньшего размера извлекаются из основной архитектуры, что упрощает дистилляцию знаний и оптимизирует развертывание систем с динамическими требованиями к вычислительным ресурсам.

Традиционный процесс создания линейки моделей требует независимого обучения и поддержки каждой версии, что влечет за собой высокие затраты на инфраструктуру и хранение весов. Метод Matryoshka решает эту проблему за счет «матрешечной» организации слоев: одна большая модель содержит в себе несколько более компактных подмоделей, которые могут работать независимо друг от друга.

Данная технология позволяет гибко переключаться между моделями разной мощности в рамках одного процесса развертывания. Это критически важно для сценариев, где требуется адаптация под доступные аппаратные мощности или ограничение задержек (latency) без необходимости держать в памяти несколько отдельных полновесных нейросетей.

Ключевые факты

  • Архитектура объединяет несколько моделей разного размера в единый обучаемый стек.
  • Метод снижает суммарное количество параметров, необходимых для обслуживания всей линейки моделей.
  • Реализована возможность эффективной дистилляции знаний от самой крупной модели ко всем остальным внутри стека.
  • Подход оптимизирует использование памяти при инференсе за счет возможности выбора подмодели нужного размера из общего архитектурного каркаса.