Исследователи представили Velocity — метод, позволяющий значительно расширить контекстное окно существующих больших языковых моделей без необходимости их дообучения. Технология обеспечивает линейное масштабирование вычислительных затрат при увеличении длины входных данных, что решает проблему квадратичной сложности стандартного механизма внимания (Attention) и открывает путь к эффективной обработке длинных документов на стандартном оборудовании.

Основная проблема современных трансформеров заключается в том, что потребление памяти и вычислительная мощность растут пропорционально квадрату длины контекста. Velocity обходит это ограничение, используя специализированные алгоритмы обработки последовательностей, которые сохраняют точность модели при работе с длинными промптами. Это позволяет разработчикам внедрять поддержку больших объемов данных в уже готовые архитектуры, не тратя ресурсы на дорогостоящий процесс переобучения весов.

Данный подход критически важен для создания агентных систем, требующих удержания в памяти больших массивов документации или истории диалогов. Благодаря линейному масштабированию, системы на базе LLM могут анализировать целые базы знаний или длинные логи выполнения задач, оставаясь при этом в рамках доступных аппаратных мощностей и сохраняя высокую скорость отклика.

Ключевые факты

  • Velocity позволяет масштабировать контекстное окно LLM без изменения параметров модели (zero-retraining).
  • Метод переводит вычислительную сложность механизма внимания из квадратичной в линейную зависимость от длины контекста.
  • Технология ориентирована на интеграцию с существующими предобученными моделями для повышения их эффективности в задачах с длинным вводом.
  • Решение направлено на снижение барьера входа для работы с большими контекстами, требующими ранее значительных вычислительных ресурсов.