Разработчики представили Kimi K3 — масштабную Mixture-of-Experts модель с общим количеством параметров 2,8 трлн. Архитектура поддерживает работу с 104 млрд активных параметров, обладает нативной поддержкой зрения и контекстным окном объемом 1 млн токенов. Новинка использует инновационные механизмы Delta Attention и Stable LatentMoE для оптимизации информационных потоков и эффективной маршрутизации экспертов.

Техническая база модели включает архитектурные улучшения, направленные на повышение стабильности при обработке длинных последовательностей и глубоких слоев нейросети. Использование Stable LatentMoE позволяет системе динамически активировать 16 из 896 доступных экспертов для каждого токена, что обеспечивает баланс между вычислительной мощностью и производительностью инференса. Интеграция нативных визуальных возможностей делает модель универсальным инструментом для мультимодальных задач.

Данный релиз знаменует очередной этап в развитии архитектур типа Mixture-of-Experts, где акцент смещается в сторону увеличения общего количества параметров при сохранении контролируемой вычислительной нагрузки. Сочетание огромного контекстного окна и оптимизированной маршрутизации экспертов позволяет модели эффективно справляться с комплексными задачами анализа данных и генерации контента, требующими глубокого понимания контекста.

Ключевые факты

  • Общее количество параметров модели составляет 2,8 триллиона.
  • Количество активных параметров при инференсе достигает 104 миллиардов.
  • Контекстное окно модели составляет 1 миллион токенов.
  • Система использует 896 экспертов, из которых для каждого токена активируются 16.
  • В архитектуре применены технологии Kimi Delta Attention и Stable LatentMoE.