Команда Cursor представила Mixture-of-Kittens — open-source решение для эффективного выполнения Mixture-of-Experts (MoE) моделей на высокопроизводительных кластерах NVIDIA NVL72. Инструмент решает проблему низкой утилизации GPU при работе с MoE-архитектурами, обеспечивая значительный прирост пропускной способности за счет оптимизации передачи данных между узлами и эффективного управления памятью в масштабируемых системах.

Основная сложность запуска MoE-моделей на больших кластерах заключается в интенсивном обмене данными между экспертами, распределенными по разным графическим процессорам. Стандартные реализации часто упираются в ограничения пропускной способности интерконнекта, что приводит к простоям вычислительных ядер. Новое решение оптимизирует планирование задач и минимизирует задержки при переключении между экспертами, позволяя полнее использовать потенциал архитектуры NVL72.

Разработка ориентирована на инфраструктурные задачи, где требуется высокая скорость инференса при работе с моделями, содержащими сотни миллиардов параметров. Использование специализированных ядер позволяет снизить накладные расходы на коммуникацию, что критически важно для масштабируемых агентных систем и сложных RAG-пайплайнов, работающих в режиме реального времени на больших объемах данных.

Ключевые факты

  • Mixture-of-Kittens — это open-source реализация MoE-ядра, оптимизированная под топологию NVIDIA NVL72.
  • Решение направлено на устранение «узких мест» при передаче данных между GPU в распределенных системах.
  • Инструмент позволяет повысить эффективность использования вычислительных ресурсов при работе с крупными MoE-моделями.
  • Разработка призвана сократить задержки при выполнении сложных запросов в высоконагруженных инфраструктурах.