Команда Cursor представила Mixture-of-Kittens (MoK) — специализированный мега-ядро для обучения моделей архитектуры Mixture-of-Experts (MoE). Решение объединяет коммуникационные и вычислительные задачи в единый детерминированный процесс, обеспечивая прирост производительности до 2,37 раза по сравнению с существующими публичными аналогами. Технология оптимизирована для работы на серверных стойках GB300 NVL72, что значительно ускоряет обучение сложных нейросетевых архитектур.

Разработка MoK направлена на устранение узких мест при масштабировании MoE-моделей, где взаимодействие между экспертами часто ограничивает пропускную способность системы. За счет слияния операций в одно ядро, разработчикам удалось минимизировать задержки при передаче данных между GPU, что критически важно при работе с кластерами высокой плотности. Детерминированный характер вычислений также упрощает отладку и воспроизводимость результатов обучения.

Использование данного инструмента накладывает строгие аппаратные требования: для работы MoK необходимы графические процессоры архитектуры Blackwell SM100 или SM103. Это делает решение узкоспециализированным инструментом для инфраструктурных команд, работающих с передовыми вычислительными мощностями NVIDIA, и фактически ограничивает его применение владельцами высокопроизводительных систем уровня NVL72.

Ключевые факты

  • MoK объединяет все вычисления и коммуникации MoE в единое детерминированное ядро.
  • Прирост скорости обучения достигает 2,37x относительно текущих публичных бенчмарков.
  • Технология требует наличия GPU архитектуры Blackwell (SM100 или SM103).
  • Оптимизация разработана специально для серверных стоек стандарта GB300 NVL72.
  • Исходный код ядра открыт для использования в высоконагруженных вычислительных средах.