Исследователи обнаружили математическую связь между архитектурой трансформеров и задачей оптимального транспорта (Entropic Optimal Transport, EOT). Оказалось, что процесс внимания (attention) в моделях по сути является итеративным алгоритмом поиска оптимального плана перемещения вероятностных масс. Это открытие дает теоретическое обоснование того, почему трансформеры эффективно обучаются на сложных распределениях данных и как именно они структурируют информацию в скрытых пространствах.

Традиционно механизмы внимания рассматривались как способ взвешенного суммирования токенов, однако новая интерпретация переводит их в плоскость теории оптимизации. В рамках этой модели каждый слой трансформера выполняет шаг градиентного спуска или итерацию алгоритма Синхорна, минимизируя «стоимость» переноса вероятности между входными и выходными представлениями. Это объясняет, почему глубокие сети способны выстраивать сложные семантические связи: они буквально «перевозят» вероятностные массы между состояниями, минимизируя энтропийные потери.

Такой подход позволяет по-новому взглянуть на архитектурные ограничения трансформеров. Если механизм внимания — это EOT-решатель, то параметры модели (веса матриц Q, K, V) определяют метрику стоимости, а количество слоев — глубину оптимизационного процесса. Это дает теоретическую базу для понимания того, как масштабирование моделей влияет на их способность к обобщению и почему определенные стратегии инициализации весов работают лучше других.

Ключевые факты

  • Механизм внимания (Attention) математически эквивалентен итеративному решению задачи энтропийного оптимального транспорта (EOT).
  • Слои трансформера интерпретируются как шаги алгоритма Синхорна, который находит оптимальный план распределения вероятностей.
  • Матрицы весов Query и Key определяют функцию стоимости (cost function) в пространстве признаков.
  • Открытие позволяет использовать методы теории оптимального транспорта для анализа сходимости и стабильности обучения LLM.
  • Интерпретация объясняет способность моделей к аппроксимации сложных распределений через минимизацию энтропийных затрат при передаче информации.