Разработчики представили Kimi K3 — масштабную Mixture-of-Experts модель с общим количеством параметров 2,8 трлн. Архитектура поддерживает работу с 104 млрд активных параметров, обладает нативной поддержкой зрения и контекстным окном объемом 1 млн токенов. Новинка использует инновационные механизмы Delta Attention и Stable LatentMoE для оптимизации информационных потоков и эффективной маршрутизации экспертов.
Техническая база модели включает архитектурные улучшения, направленные на повышение стабильности при обработке длинных последовательностей и глубоких слоев нейросети. Использование Stable LatentMoE позволяет системе динамически активировать 16 из 896 доступных экспертов для каждого токена, что обеспечивает баланс между вычислительной мощностью и производительностью инференса. Интеграция нативных визуальных возможностей делает модель универсальным инструментом для мультимодальных задач.
Данный релиз знаменует очередной этап в развитии архитектур типа Mixture-of-Experts, где акцент смещается в сторону увеличения общего количества параметров при сохранении контролируемой вычислительной нагрузки. Сочетание огромного контекстного окна и оптимизированной маршрутизации экспертов позволяет модели эффективно справляться с комплексными задачами анализа данных и генерации контента, требующими глубокого понимания контекста.
Ключевые факты
- Общее количество параметров модели составляет 2,8 триллиона.
- Количество активных параметров при инференсе достигает 104 миллиардов.
- Контекстное окно модели составляет 1 миллион токенов.
- Система использует 896 экспертов, из которых для каждого токена активируются 16.
- В архитектуре применены технологии Kimi Delta Attention и Stable LatentMoE.