Исследователи и технологические стартапы активно ищут замену архитектуре трансформеров, которая доминирует в индустрии с 2017 года. Несмотря на эффективность текущих LLM, их масштабирование требует колоссальных вычислительных ресурсов. Новые компании фокусируются на альтернативных подходах, способных обеспечить высокую производительность при меньших затратах памяти и энергии, что может стать следующим значимым сдвигом в развитии генеративного ИИ.

Основная проблема современных моделей заключается в квадратичной зависимости вычислительной сложности от длины контекста. Это ограничивает возможности работы с длинными документами и видеопотоками в реальном времени. Разработчики экспериментируют с архитектурами, которые предлагают линейную масштабируемость, что критически важно для создания более эффективных и доступных агентных систем.

Инвестиции в этом секторе смещаются от простого наращивания параметров моделей к поиску фундаментальных инноваций в способах обработки данных. Компании стремятся оптимизировать процесс «внимания» (attention), который лежит в основе успеха трансформеров, пытаясь сохранить качество генерации при значительном снижении требований к инфраструктуре инференса.

Ключевые факты

  • Архитектура трансформеров была представлена Google в 2017 году в статье «Attention Is All You Need».
  • Квадратичная сложность вычислений в трансформерах становится главным барьером для обработки сверхдлинных контекстов.
  • Новые архитектурные подходы нацелены на переход к линейной зависимости сложности от объема входных данных.
  • Основной фокус стартапов — снижение стоимости инференса и повышение энергоэффективности моделей для работы на широком спектре устройств.