Together AI представила ThunderAgent — планировщик для агентного инференса, оптимизирующий выполнение сложных рабочих процессов. Система рассматривает агентные цепочки как планируемые программы, что позволяет устранить избыточное использование KV-кэша. В результате пропускная способность на одном узле увеличивается более чем в два раза, обеспечивая при этом практически линейное масштабирование при работе на нескольких узлах одновременно.
Основная проблема традиционных систем при работе с агентами заключается в неэффективном управлении памятью, особенно когда модель постоянно переключается между различными контекстами и задачами. ThunderAgent решает эту проблему за счет интеллектуального планирования, которое синхронизирует выполнение запросов с доступными вычислительными ресурсами. Это критически важно для генерации синтетических данных в больших масштабах, где задержки инференса становятся главным узким местом.
Технология ориентирована на высоконагруженные сценарии, где требуется параллельная обработка множества агентных вызовов. Вместо того чтобы обрабатывать каждый запрос изолированно, планировщик группирует задачи, минимизируя простои оборудования и оптимизируя использование видеопамяти. Такой подход позволяет значительно снизить стоимость генерации данных и сократить время подготовки обучающих выборок для новых моделей.
Ключевые факты
- ThunderAgent обеспечивает прирост пропускной способности более чем в 2 раза на одном узле.
- Система поддерживает практически линейное масштабирование при распределенных вычислениях на нескольких узлах.
- Основной механизм оптимизации заключается в устранении «thrashing» (избыточного вытеснения) KV-кэша.
- Решение специально разработано для задач генерации синтетических данных в промышленном масштабе.
