Исследователи представили архитектурный подход, позволяющий выполнять операции инференса больших языковых моделей непосредственно внутри оперативной памяти (Processing-in-Memory). Это решение устраняет проблему «узкого места памяти», ограничивающую скорость передачи данных между процессором и RAM, что критически важно для эффективного запуска тяжелых моделей на локальном оборудовании и снижения задержек при генерации токенов.
Традиционная архитектура фон Неймана требует постоянной пересылки весов модели из памяти в вычислительные блоки, что создает значительные задержки и энергозатраты. Новый метод переносит часть вычислительной нагрузки непосредственно на контроллеры памяти, минимизируя перемещение данных. Это позволяет значительно повысить пропускную способность системы при работе с параметрами моделей, которые превышают объем кэша процессора.
Технология ориентирована на оптимизацию работы с крупными LLM, где объем весов становится главным препятствием для быстрого отклика. Переход к вычислениям внутри RAM позволяет масштабировать производительность инференса без необходимости радикального увеличения тактовой частоты процессора, что открывает новые возможности для развертывания мощных ИИ-систем на стандартном серверном и потребительском железе.
Ключевые факты
- Метод направлен на преодоление «стены памяти» (memory wall), ограничивающей скорость обмена данными между CPU/GPU и RAM.
- Архитектура Processing-in-Memory (PIM) позволяет выполнять матричные операции непосредственно в модулях памяти.
- Решение значительно снижает энергопотребление за счет сокращения количества циклов передачи данных по шине.
- Подход позволяет эффективнее использовать доступную пропускную способность памяти при работе с моделями, содержащими десятки и сотни миллиардов параметров.