Исследователи представили Loopie — новую серию моделей на архитектуре Looped Transformer, использующих принцип Mixture-of-Experts (MoE). Линейка включает две версии: модель с 20 млрд параметров (2 млрд активных) и модель с 6 млрд параметров (0,6 млрд активных). Разработка направлена на преодоление ограничений эффективности обучения, характерных для систем с многократным повторным использованием весов в глубоких нейронных сетях.

Основная проблема классических «зацикленных» трансформеров заключается в том, что при увеличении вычислительных затрат на обучение в N раз, простое масштабирование количества параметров часто оказывается более эффективным подходом. Авторы Loopie предлагают решение, которое позволяет более рационально использовать вычислительный бюджет, сохраняя при этом высокую производительность при ограниченном количестве активных параметров во время инференса.

Использование MoE-архитектуры в сочетании с концепцией циклического прохода данных позволяет достичь баланса между глубиной модели и её вычислительной сложностью. Это делает Loopie перспективным решением для сценариев, где требуется высокая точность при ограниченных ресурсах памяти и вычислительных мощностях, характерных для современных трансформеров.

Ключевые факты

  • Серия Loopie включает две модели: 20B (2B активных) и 6B (0,6B активных).
  • Архитектура основана на принципе Mixture-of-Experts (MoE) с использованием циклического прохода весов.
  • Исследование направлено на оптимизацию соотношения вычислительных затрат на претрейнинг и итогового количества параметров.
  • Модели демонстрируют эффективность в условиях, когда стандартное масштабирование параметров становится менее выгодным по сравнению с оптимизацией циклов обучения.