Исследователи представили детальный анализ архитектур трансформеров, исключающих слои MLP (Multi-Layer Perceptron). Работа демонстрирует, что модели, состоящие исключительно из механизмов внимания, способны достигать результатов, сопоставимых с классическими трансформерами, при условии правильной настройки гиперпараметров. Это ставит под сомнение необходимость обязательного использования полносвязных слоев для эффективного обучения языковых моделей и понимания их внутренних представлений.
В ходе эксперимента авторы провели контролируемое сравнение стандартных архитектур и их упрощенных версий. Выяснилось, что при увеличении глубины сети модели без MLP демонстрируют устойчивую динамику обучения. Основной упор в работе сделан на изоляцию вклада механизма внимания в процесс обработки контекста и формирования весов, что позволяет лучше интерпретировать работу нейронных сетей.
Полученные данные указывают на то, что текущие стандарты архитектур могут быть избыточными. Упрощение структуры модели не только снижает вычислительные затраты на инференс, но и упрощает математический анализ того, как именно модель извлекает и комбинирует признаки из входных данных. Это открывает новые возможности для создания более компактных и прозрачных архитектур для специфических задач обработки естественного языка.
Ключевые факты
- Исследование сфокусировано на архитектурах, полностью лишенных слоев MLP, оставляя только механизмы внимания.
- Установлено, что при увеличении количества слоев модели Attention-Only показывают производительность, близкую к стандартным трансформерам.
- Работа подчеркивает избыточность параметров в классических архитектурах и предлагает пути оптимизации для снижения вычислительной сложности.
- Результаты исследования позволяют глубже понять механизмы обучения трансформеров и их способность к аппроксимации функций без классических полносвязных блоков.