Исследователи из Liquid AI представили эффективный метод расширения словаря токенизатора уже обученной языковой модели. Подход позволяет добавлять новые токены, не прибегая к дорогостоящему переобучению всей архитектуры с нуля. Это значительно упрощает адаптацию моделей под специфические языки, домены или новые форматы данных, сохраняя при этом накопленные веса и производительность системы.

Традиционно изменение размера словаря требует полной перетренировки модели, так как матрица эмбеддингов жестко привязана к исходному набору токенов. Новый метод использует стратегию инициализации новых эмбеддингов на основе семантической близости к уже существующим векторам. Это позволяет модели быстро «понять» новые токены в процессе дообучения, минимизируя деградацию качества при работе с исходными данными.

Технология особенно актуальна для оптимизации инференса и повышения точности моделей в узкоспециализированных задачах, где требуется поддержка редких символов или специфической терминологии. Такой подход снижает вычислительные затраты на адаптацию моделей, делая процесс итеративного улучшения архитектур более доступным и гибким для разработчиков инфраструктурных решений.

Ключевые факты

  • Метод позволяет обновлять токенизатор «на месте» без необходимости полного переобучения модели.
  • Инициализация новых эмбеддингов происходит через анализ семантической близости к существующим векторам в пространстве модели.
  • Технология сокращает вычислительные ресурсы, необходимые для адаптации LLM под новые языки или доменные области.
  • Подход обеспечивает сохранение производительности модели на исходных данных после расширения словаря.
  • Решение ориентировано на повышение эффективности дообучения и кастомизации готовых нейросетевых архитектур.