Исследователи обнаружили фундаментальную проблему в механизме позиционного кодирования ALiBi, используемом в ряде популярных LLM. Линейное масштабирование смещения приводит к потере точности вычислений с плавающей запятой, из-за чего значительная часть весов внимания обнуляется. Это делает отдельные головы внимания «слепыми», существенно снижая способность модели корректно обрабатывать контекст и длинные последовательности данных.
Проблема возникает из-за того, что при определенных условиях значения смещений выходят за пределы допустимой точности представления чисел, что приводит к их принудительному обнулению. В результате модель перестает учитывать информацию из определенных сегментов входного текста, даже если архитектурно она должна это делать. Этот эффект проявляется как скрытая деградация качества генерации, которую сложно отследить стандартными методами тестирования.
Авторы работы проанализировали механизм возникновения ошибки и предложили четыре стратегии для её устранения. Эти методы позволяют сохранить работоспособность голов внимания без необходимости полной переработки архитектуры позиционного кодирования. Результаты исследования подчеркивают важность проверки численной стабильности компонентов трансформеров при масштабировании моделей.
Ключевые факты
- ALiBi (Attention with Linear Biases) страдает от потери точности из-за переполнения или обнуления значений при линейном масштабировании.
- Ошибка приводит к тому, что значительная доля весов внимания становится нулевой, фактически отключая работу отдельных голов внимания.
- Исследование предлагает четыре конкретных способа минимизации риска численных сбоев в механизме внимания.
- Проблема была выявлена в ходе анализа численной стабильности современных архитектур трансформеров при работе с длинными контекстами.