Исследователи представили AdaFlash — новый метод ускорения инференса больших языковых моделей, использующий адаптивное спекулятивное декодирование. В основе подхода лежит применение диффузионных моделей в качестве «черновиков» (drafters), которые генерируют последовательности токенов параллельно. Метод оптимизирует процесс верификации целевой моделью, значительно снижая задержки при генерации текста без потери качества ответов по сравнению со стандартными методами.
Спекулятивное декодирование традиционно опирается на легковесные авторегрессионные модели для предсказания будущих токенов. Однако такие модели часто ограничены в качестве генерации, что приводит к высокому уровню отказов при проверке основной моделью. AdaFlash решает эту проблему за счет использования диффузионных моделей, обученных методом on-policy дистилляции, что позволяет генерировать более точные и длинные последовательности за один проход.
Ключевым преимуществом AdaFlash является адаптивность: система динамически подстраивает процесс генерации черновиков под сложность задачи и текущую нагрузку. Это позволяет эффективно использовать вычислительные ресурсы GPU, минимизируя время ожидания между генерацией токенов. Технология демонстрирует высокую эффективность в сценариях, где требуется низкая задержка при работе с моделями большого размера.
Ключевые факты
- Метод использует диффузионные модели в качестве drafters для параллельной генерации токенов.
- Применяется техника on-policy дистилляции для повышения точности черновиков.
- Адаптивный механизм позволяет динамически регулировать длину и качество генерируемых последовательностей.
- Подход направлен на снижение задержек при инференсе LLM за счет уменьшения количества итераций верификации.
- Метод оптимизирует взаимодействие между легковесным drafter-ом и целевой большой языковой моделью.