Лян Вэньфэн, технический директор DeepSeek, впервые подробно рассказал о стратегии компании в области разработки больших языковых моделей. Основной акцент сделан на эффективности обучения, оптимизации архитектуры и отказе от слепого масштабирования вычислительных мощностей. Компания делает ставку на алгоритмические инновации, которые позволяют достигать результатов уровня ведущих мировых моделей при значительно меньших затратах на инфраструктуру.
В основе подхода DeepSeek лежит глубокая оптимизация процесса обучения, включая использование специализированных архитектур, таких как Mixture-of-Experts (MoE), и инновационных методов распределенных вычислений. В отличие от многих конкурентов, которые стремятся к бесконечному увеличению количества параметров, DeepSeek фокусируется на качестве данных и эффективности использования каждого вычислительного цикла. Это позволяет компании сохранять высокую скорость итераций при ограниченных ресурсах.
Разработчики подчеркивают, что текущий успех моделей DeepSeek стал возможен благодаря пересмотру фундаментальных подходов к архитектуре нейросетей. Вместо того чтобы просто наращивать объемы данных, команда сосредоточилась на создании более компактных и производительных моделей, которые могут эффективно работать в различных сценариях применения. Такой подход меняет представление о том, насколько затратным должно быть создание передового ИИ.
Ключевые факты
- Лян Вэньфэн подтвердил приоритет алгоритмической эффективности над простым наращиванием вычислительных мощностей.
- Основной упор в разработке делается на архитектуру Mixture-of-Experts (MoE) для оптимизации инференса и обучения.
- Стратегия компании направлена на снижение стоимости обучения моделей при сохранении их конкурентоспособности с лидерами рынка.
- DeepSeek активно инвестирует в собственные методы распределенных вычислений для ускорения итераций разработки.