Tencent представила AngelSpec — фреймворк для обучения моделей-черновиков, предназначенных для спекулятивного декодирования. Решение поддерживает шесть архитектур и внедряет метод DFly, использующий блочную диффузию и гибридное кондиционирование. Инструмент позволяет значительно повысить скорость генерации текста на крупных языковых моделях, обеспечивая прирост производительности до 2,4 раз при выполнении сложных задач инференса в распределенных средах.
Спекулятивное декодирование — ключевой метод оптимизации, при котором быстрая и легкая модель-черновик предсказывает последовательность токенов, а основная модель их верифицирует. AngelSpec автоматизирует процесс обучения таких «драфтеров», позволяя адаптировать их под конкретные целевые модели. В состав фреймворка входит механизм D-cut, который динамически управляет бюджетом верификации в процессе работы, что критично для поддержания стабильной скорости при переменной нагрузке.
Технология ориентирована на работу с моделями сверхбольшого размера, такими как HY3-295B. Использование блочно-параллельного подхода и специфических архитектурных решений позволяет минимизировать задержки, возникающие при передаче данных между узлами в кластерах с параллелизмом тензоров. Это делает AngelSpec важным инструментом для инфраструктурных команд, работающих над снижением стоимости и времени отклика при развертывании LLM в продакшене.
Ключевые факты
- AngelSpec поддерживает обучение моделей-черновиков для шести различных архитектур LLM.
- Внедрен метод DFly, использующий блочную диффузию и авторегрессионную голову с коррекцией скрытых состояний.
- Интегрирован алгоритм D-cut для адаптивного управления бюджетом верификации в режиме реального времени.
- При тестировании на модели HY3-295B-A21B с параллелизмом тензоров (TP=8) достигнуто ускорение инференса в 1,98–2,40 раза.
- Фреймворк реализован на базе PyTorch и доступен как open-source решение.
