AMD выпустила Instella-MoE-16B-A3B — полностью открытую языковую модель с архитектурой Mixture-of-Experts, обученную с нуля на собственных ускорителях Instinct. Модель содержит 16 миллиардов параметров, однако для обработки каждого токена задействует лишь 2,8 миллиарда. Компания предоставила полный доступ к весам на всех этапах обучения, конфигурациям, наборам данных и коду для инференса.

Разработка модели велась с использованием специализированных архитектурных решений, включая Gated MLA и технологию FarSkip-Collective, что позволило оптимизировать производительность на аппаратном обеспечении AMD. Публикация всех промежуточных данных обучения является важным шагом для исследователей, изучающих динамику сходимости MoE-моделей и эффективность обучения на GPU серии Instinct.

Данный релиз расширяет экосистему открытых моделей, предоставляя разработчикам прозрачный инструмент для локального развертывания и дообучения. Использование разреженной архитектуры позволяет достичь высокой скорости генерации при сохранении качества ответов, сопоставимого с более крупными плотными моделями, что делает Instella-MoE-16B-A3B эффективным решением для задач с ограниченными вычислительными ресурсами.

Ключевые факты

  • Общее количество параметров модели составляет 16 миллиардов.
  • Количество активных параметров на один токен ограничено 2,8 миллиардами.
  • Обучение проводилось на ускорителях AMD Instinct MI300X и MI325X.
  • В архитектуре применены технологии Gated MLA и FarSkip-Collective.
  • В открытый доступ выложены веса всех этапов обучения, конфигурации и датасеты.