Лян Вэньфэн, технический директор DeepSeek, раскрыл детали стратегии компании на закрытой встрече с инвесторами. Основной упор сделан на экстремальную оптимизацию затрат при обучении моделей и архитектурную эффективность. Компания делает ставку на собственные методы распределенных вычислений и алгоритмические инновации, которые позволяют достигать результатов уровня топовых моделей при значительно меньших вычислительных мощностях и финансовых вложениях.
В ходе обсуждения была подчеркнута важность перехода от простого масштабирования параметров к повышению качества данных и эффективности обучения. DeepSeek активно развивает инфраструктуру, позволяющую минимизировать накладные расходы при передаче данных между GPU, что является критическим узлом для обучения моделей с миллиардами параметров. Такой подход позволяет компании сохранять высокую скорость итераций, не вступая в прямую гонку капитальных затрат с крупнейшими игроками рынка.
Особое внимание уделено развитию экосистемы вокруг моделей с открытым весом. Стратегия DeepSeek предполагает, что доступность высокопроизводительных и эффективных моделей для сообщества способствует их более быстрому внедрению в прикладные задачи, что в конечном итоге укрепляет позиции компании как технологического лидера. Разработчики сфокусированы на создании инструментов, которые упрощают интеграцию их решений в существующие корпоративные стеки.
Ключевые факты
- DeepSeek делает ставку на архитектурные оптимизации, снижающие стоимость обучения моделей в разы по сравнению с рыночными стандартами.
- Основным технологическим преимуществом названа собственная система распределенных вычислений, минимизирующая задержки при обмене данными между графическими процессорами.
- Компания придерживается стратегии открытого доступа к весам моделей для ускорения их адаптации и внедрения в индустрии.
- Лян Вэньфэн подтвердил, что эффективность алгоритмов важнее бесконечного увеличения вычислительного кластера для достижения SOTA-результатов.