Исследователи и технологические стартапы активно ищут замену архитектуре трансформеров, которая доминирует в индустрии с 2017 года. Несмотря на эффективность текущих LLM, их масштабирование требует колоссальных вычислительных ресурсов. Новые компании фокусируются на альтернативных подходах, способных обеспечить высокую производительность при меньших затратах памяти и энергии, что может стать следующим значимым сдвигом в развитии генеративного ИИ.
Основная проблема современных моделей заключается в квадратичной зависимости вычислительной сложности от длины контекста. Это ограничивает возможности работы с длинными документами и видеопотоками в реальном времени. Разработчики экспериментируют с архитектурами, которые предлагают линейную масштабируемость, что критически важно для создания более эффективных и доступных агентных систем.
Инвестиции в этом секторе смещаются от простого наращивания параметров моделей к поиску фундаментальных инноваций в способах обработки данных. Компании стремятся оптимизировать процесс «внимания» (attention), который лежит в основе успеха трансформеров, пытаясь сохранить качество генерации при значительном снижении требований к инфраструктуре инференса.
Ключевые факты
- Архитектура трансформеров была представлена Google в 2017 году в статье «Attention Is All You Need».
- Квадратичная сложность вычислений в трансформерах становится главным барьером для обработки сверхдлинных контекстов.
- Новые архитектурные подходы нацелены на переход к линейной зависимости сложности от объема входных данных.
- Основной фокус стартапов — снижение стоимости инференса и повышение энергоэффективности моделей для работы на широком спектре устройств.
