Спекулятивное декодирование — это метод ускорения генерации текста LLM, при котором маленькая и быстрая модель («драфтовая») предсказывает последовательность токенов, а основная модель проверяет их параллельно. Это позволяет обрабатывать несколько токенов за один проход инференса, значительно сокращая задержки при генерации без потери точности ответов, так как итоговый результат всегда соответствует основной модели.

Основная проблема классического инференса заключается в последовательном характере генерации: каждый следующий токен требует отдельного обращения к памяти и вычислений. Спекулятивный подход меняет парадигму, делегируя предсказание «черновика» легковесной модели. Если предсказание совпадает с ответом основной модели, система принимает сразу несколько токенов, что кратно повышает пропускную способность системы.

Эффективность метода напрямую зависит от качества драфтовой модели и её способности угадывать распределение вероятностей основной модели. В случае частых ошибок «черновика» система вынуждена откатываться к стандартному пошаговому процессу, что нивелирует выигрыш в скорости. Тем не менее, для задач с высокой нагрузкой на инференс этот подход становится стандартом оптимизации инфраструктуры.

Ключевые факты

  • Метод позволяет ускорить генерацию текста в 2–3 раза при сохранении качества ответов основной модели.
  • Спекулятивное декодирование минимизирует количество обращений к памяти GPU, что является главным «бутылочным горлышком» при работе с LLM.
  • Основная модель выступает в роли верификатора, который подтверждает или отклоняет токены, предложенные драфтовой моделью.
  • Технология наиболее эффективна при использовании драфтовых моделей, обученных специально для работы в паре с конкретной большой моделью.