Tencent представила AngelSpec — фреймворк для обучения моделей-черновиков, предназначенных для спекулятивного декодирования. Решение поддерживает шесть архитектур и внедряет метод DFly, использующий блочную диффузию и гибридное кондиционирование. Инструмент позволяет значительно повысить скорость генерации текста на крупных языковых моделях, обеспечивая прирост производительности до 2,4 раз при выполнении сложных задач инференса в распределенных средах.

Спекулятивное декодирование — ключевой метод оптимизации, при котором быстрая и легкая модель-черновик предсказывает последовательность токенов, а основная модель их верифицирует. AngelSpec автоматизирует процесс обучения таких «драфтеров», позволяя адаптировать их под конкретные целевые модели. В состав фреймворка входит механизм D-cut, который динамически управляет бюджетом верификации в процессе работы, что критично для поддержания стабильной скорости при переменной нагрузке.

Технология ориентирована на работу с моделями сверхбольшого размера, такими как HY3-295B. Использование блочно-параллельного подхода и специфических архитектурных решений позволяет минимизировать задержки, возникающие при передаче данных между узлами в кластерах с параллелизмом тензоров. Это делает AngelSpec важным инструментом для инфраструктурных команд, работающих над снижением стоимости и времени отклика при развертывании LLM в продакшене.

Ключевые факты

  • AngelSpec поддерживает обучение моделей-черновиков для шести различных архитектур LLM.
  • Внедрен метод DFly, использующий блочную диффузию и авторегрессионную голову с коррекцией скрытых состояний.
  • Интегрирован алгоритм D-cut для адаптивного управления бюджетом верификации в режиме реального времени.
  • При тестировании на модели HY3-295B-A21B с параллелизмом тензоров (TP=8) достигнуто ускорение инференса в 1,98–2,40 раза.
  • Фреймворк реализован на базе PyTorch и доступен как open-source решение.