Команда Cursor представила Mixture-of-Kittens — open-source решение для эффективного выполнения Mixture-of-Experts (MoE) моделей на высокопроизводительных кластерах NVIDIA NVL72. Инструмент решает проблему низкой утилизации GPU при работе с MoE-архитектурами, обеспечивая значительный прирост пропускной способности за счет оптимизации передачи данных между узлами и эффективного управления памятью в масштабируемых системах.
Основная сложность запуска MoE-моделей на больших кластерах заключается в интенсивном обмене данными между экспертами, распределенными по разным графическим процессорам. Стандартные реализации часто упираются в ограничения пропускной способности интерконнекта, что приводит к простоям вычислительных ядер. Новое решение оптимизирует планирование задач и минимизирует задержки при переключении между экспертами, позволяя полнее использовать потенциал архитектуры NVL72.
Разработка ориентирована на инфраструктурные задачи, где требуется высокая скорость инференса при работе с моделями, содержащими сотни миллиардов параметров. Использование специализированных ядер позволяет снизить накладные расходы на коммуникацию, что критически важно для масштабируемых агентных систем и сложных RAG-пайплайнов, работающих в режиме реального времени на больших объемах данных.
Ключевые факты
- Mixture-of-Kittens — это open-source реализация MoE-ядра, оптимизированная под топологию NVIDIA NVL72.
- Решение направлено на устранение «узких мест» при передаче данных между GPU в распределенных системах.
- Инструмент позволяет повысить эффективность использования вычислительных ресурсов при работе с крупными MoE-моделями.
- Разработка призвана сократить задержки при выполнении сложных запросов в высоконагруженных инфраструктурах.