Опубликован структурированный план обучения «Time-to-first-token», рассчитанный на 10 недель ежедневных 30-минутных занятий. Программа охватывает ключевые аспекты работы с инференсом LLM: от основ архитектуры трансформеров и работы с тензорами до продвинутых методов оптимизации, таких как квантование, KV-кэширование и использование специализированных библиотек для ускорения генерации токенов на различном оборудовании.
Материал ориентирован на инженеров, которые хотят глубоко разобраться в том, как именно модели обрабатывают запросы и почему возникают задержки при генерации. Обучение разбито на логические этапы, позволяющие постепенно освоить стек технологий для запуска моделей: от понимания математики весов до практического применения инструментов профилирования и оптимизации пропускной способности.
Курс не ограничивается теорией и предлагает прикладной подход к изучению стека инференса. Основное внимание уделяется устранению «узких мест», которые влияют на скорость получения первого токена, что критически важно для создания отзывчивых агентных систем и приложений реального времени, работающих с большими языковыми моделями.
Ключевые факты
- Программа рассчитана на 10 недель интенсивного изучения.
- Ежедневная нагрузка составляет 30 минут.
- Основные темы: архитектура трансформеров, квантование, KV-кэширование, профилирование.
- Цель курса: минимизация задержки Time-to-First-Token (TTFT) при развертывании LLM.
- Ресурс доступен в формате открытого репозитория на GitHub.