Исследователи представили архитектуру Role-Decoupled Attention Residuals (RDAR), которая разделяет процессы поиска соответствий и извлечения контента в слоях Transformer. В отличие от стандартных моделей, где запросы, ключи и значения формируются через единый механизм, RDAR независимо управляет этими потоками, что позволяет эффективнее использовать информацию из предыдущих слоев и улучшает качество глубоких нейронных сетей.

Существующие архитектуры с маршрутизацией по глубине (depth-routing) часто сталкиваются с проблемой «связанности» решений: механизм внимания одновременно определяет, откуда брать данные и как их интерпретировать. RDAR устраняет это ограничение, позволяя модели гибко выбирать контекст для формирования запросов и ключей отдельно от процесса извлечения самих значений. Это приводит к более точной настройке внимания на релевантные признаки на разных уровнях глубины сети.

Такой подход решает проблему избыточности в глубоких трансформерах, где стандартные механизмы внимания могут перегружаться из-за смешивания функций поиска и извлечения. Разделение ролей позволяет модели лучше сохранять долгосрочные зависимости и снижает вероятность потери информации при прохождении через большое количество слоев, что критически важно для обучения масштабных языковых моделей.

Ключевые факты

  • Архитектура RDAR разделяет формирование запросов (queries), ключей (keys) и значений (values) в механизме внимания.
  • Метод оптимизирует работу depth-routing residual сетей, позволяя модели динамически выбирать представления из ранних слоев.
  • Разделение функций поиска и извлечения снижает когнитивную нагрузку на каждый слой трансформера.
  • Исследование направлено на повышение эффективности глубоких моделей без необходимости значительного увеличения количества параметров.