Исследователи Google DeepMind разработали DiffusionGemma — текстовую модель, построенную на принципах диффузии, а не традиционной авторегрессии. Используя архитектуру Gemma 2, команда адаптировала её под новый метод генерации, затратив менее 10% от исходного бюджета обучения. Система способна генерировать до 256 токенов параллельно, достигая скорости около 1500 токенов в секунду.

Традиционные LLM генерируют текст последовательно, предсказывая каждый следующий токен, что создает «узкое горлышко» при масштабировании скорости вывода. Подход с использованием диффузионных моделей позволяет генерировать блоки текста одновременно. Хотя текущая версия DiffusionGemma уступает классическим авторегрессионным моделям в задачах на логическое рассуждение и качестве ответов, этот эксперимент доказывает возможность эффективной конвертации существующих весов в новые архитектурные парадигмы.

Данная работа открывает перспективы для создания высокоскоростных систем генерации, где параллелизм становится ключевым преимуществом. Исследователи сфокусировались на оптимизации процесса обучения, показав, что дообучение предобученных моделей под диффузионные задачи требует значительно меньше вычислительных ресурсов, чем создание аналогичных систем с нуля.

Ключевые факты

  • Модель DiffusionGemma базируется на архитектуре Gemma 2 от Google.
  • Скорость генерации достигает 1500 токенов в секунду за счет параллельной обработки 256 токенов.
  • Затраты на обучение составили менее 10% от бюджета, необходимого для создания модели с нуля.
  • Текущие бенчмарки показывают отставание в качестве генерации и логических способностях по сравнению с авторегрессионными аналогами.