Исследователи представили ParVL — метод масштабирования мультимодальных больших языковых моделей (MLLM), который устраняет жесткую привязку вычислительных ресурсов между визуальным энкодером и текстовым декодером. В отличие от традиционных подходов, увеличивающих задержку или потребление памяти, ParVL динамически распределяет вычисления, позволяя гибко адаптировать архитектуру под конкретные задачи без существенных накладных расходов на инференс.

Существующие стратегии масштабирования мультимодальных моделей часто упираются в ограничение: фиксированное соотношение вычислительной мощности между Vision Transformer (ViT) и языковой моделью (LLM) не позволяет эффективно обрабатывать задачи с разным уровнем сложности визуального восприятия. ParVL вводит механизм параллельного масштабирования, который позволяет независимо наращивать вычислительные ресурсы для каждой модальности в зависимости от требований конкретного запроса.

Такой подход решает проблему избыточных вычислений в сценариях, где визуальная информация требует детального анализа, а текстовая часть — минимальной обработки, или наоборот. Технология позволяет оптимизировать использование памяти и снизить общую задержку при сохранении высокой точности ответов, что критически важно для развертывания сложных мультимодальных систем в продакшене.

Ключевые факты

  • ParVL внедряет механизм динамического распределения вычислительных мощностей между визуальным и текстовым компонентами модели.
  • Метод позволяет избежать линейного роста задержки (latency) при увеличении параметров модели.
  • Архитектура устраняет жесткую фиксацию ресурсов, характерную для стандартных мультимодальных трансформеров.
  • Решение направлено на повышение эффективности инференса в задачах, требующих глубокого анализа визуальных данных в сочетании с LLM.