Исследователи предложили метод CoMem, использующий неравномерное распределение функций внутри слоев трансформеров. Нижние и средние слои отвечают за формирование семантических представлений, а верхние — за предсказание. Новый подход позволяет кэшировать промежуточные состояния и перевычислять только верхние слои, что обеспечивает эффективную работу с неограниченным контекстом без необходимости обработки всей последовательности на каждом шаге.
Архитектура современных LLM демонстрирует специализацию слоев: начальные блоки модели заняты извлечением смысловых связей из входных данных, тогда как финальные слои адаптируют эти данные для генерации конкретных токенов. Метод CoMem эксплуатирует эту особенность, разделяя процесс обработки на два этапа: сжатие контекста в промежуточное представление и последующую генерацию на основе кэшированных данных.
Такой подход значительно снижает вычислительные затраты при работе с длинными текстами. Вместо того чтобы пропускать огромные объемы данных через всю глубину модели, система сохраняет «понимание» текста на промежуточном уровне. Это позволяет масштабировать контекстное окно, сохраняя при этом высокую точность предсказаний и снижая требования к оперативной памяти при инференсе.
Ключевые факты
- Метод CoMem разделяет слои трансформера на семантические (нижние/средние) и предиктивные (верхние).
- Система записывает каждый фрагмент контекста через промежуточный слой, минимизируя избыточные вычисления.
- Использование кэшированных остаточных состояний позволяет эффективно обрабатывать неограниченный объем входных данных.
- Перевычисление только верхних слоев, обусловленное конкретным запросом, ускоряет генерацию ответов при работе с длинным контекстом.