Исследователи представили MODUS — архитектуру типа decoder-only, предназначенную для создания универсальных any-to-any моделей. В отличие от традиционных подходов, использующих энкодер-декодерные или диффузионные структуры, MODUS позволяет эффективно обучать нейросети, способные предсказывать любые типы данных на основе произвольных комбинаций входных модальностей, что значительно упрощает масштабирование и повышает точность работы в различных научных и прикладных задачах.

Основная проблема существующих мультимодальных систем заключается в сложности их обучения с нуля и жесткой привязке к конкретным архитектурным паттернам. MODUS предлагает унифицированный подход, при котором модель воспринимает различные типы данных как последовательности токенов. Это позволяет интегрировать визуальные, текстовые и специализированные научные данные в рамках единого вычислительного графа без необходимости проектирования отдельных модулей для каждого типа модальности.

Такой подход особенно перспективен для областей, где требуется обработка разнородных данных, например, в экологии или астрономии. Переход на decoder-only архитектуру обеспечивает более высокую гибкость при дообучении и позволяет использовать накопленные знания из предобученных языковых моделей, что сокращает вычислительные затраты и время, необходимое для достижения высокой точности на специфических наборах данных.

Ключевые факты

  • MODUS использует архитектуру decoder-only для реализации концепции any-to-any моделирования.
  • Система поддерживает предсказание любых модальностей из произвольных комбинаций входных данных в рамках одной сети.
  • Метод направлен на решение проблем эффективности, характерных для классических энкодер-декодерных и диффузионных моделей.
  • Архитектура адаптирована для применения в сложных научных доменах, включая астрономию и экологию.