Исследователи представили формальную теорию, описывающую вычислительные возможности трансформеров с причинно-следственной маскировкой (causally masked) в условиях ограниченной точности вычислений. Авторы доказывают, что при конечном представлении чисел порядок операций и ошибки округления критически влияют на то, какую информацию механизм внимания способен сохранять и обрабатывать, что ограничивает или расширяет спектр решаемых моделью задач для произвольной длины входных данных.
Традиционные подходы к анализу архитектур часто опираются на идеализированную арифметику, игнорируя аппаратные ограничения. Новая модель переносит акцент на алгебраическую формализацию, позволяющую напрямую выводить выразительную мощность нейросети из её архитектурных параметров и точности вычислений. Это помогает понять, почему модели с фиксированной глубиной и ограниченной памятью демонстрируют разную эффективность при решении алгоритмических задач.
Работа предлагает математический аппарат для оценки того, какие типы логических и вычислительных проблем принципиально доступны трансформерам. Это фундаментальное исследование позволяет лучше предсказывать поведение моделей при масштабировании и оптимизации, объясняя ограничения, возникающие из-за взаимодействия механизмов внимания с конечной точностью представления данных.
Ключевые факты
- Исследование фокусируется на влиянии конечной точности (finite precision) на вычислительную мощность трансформеров.
- Теория доказывает, что ошибки округления и порядок вычислений в механизме внимания определяют объем сохраняемой информации.
- Предложен алгебраический метод формализации, связывающий архитектуру модели с её способностью решать задачи произвольной длины.
- Работа уточняет границы применимости трансформеров в задачах, требующих точных алгоритмических вычислений, выходящих за рамки простого распознавания паттернов.