Исследователи из Liquid AI представили эффективный метод расширения словаря токенизатора уже обученной языковой модели. Подход позволяет добавлять новые токены, не прибегая к дорогостоящему переобучению всей архитектуры с нуля. Это значительно упрощает адаптацию моделей под специфические языки, домены или новые форматы данных, сохраняя при этом накопленные веса и производительность системы.
Традиционно изменение размера словаря требует полной перетренировки модели, так как матрица эмбеддингов жестко привязана к исходному набору токенов. Новый метод использует стратегию инициализации новых эмбеддингов на основе семантической близости к уже существующим векторам. Это позволяет модели быстро «понять» новые токены в процессе дообучения, минимизируя деградацию качества при работе с исходными данными.
Технология особенно актуальна для оптимизации инференса и повышения точности моделей в узкоспециализированных задачах, где требуется поддержка редких символов или специфической терминологии. Такой подход снижает вычислительные затраты на адаптацию моделей, делая процесс итеративного улучшения архитектур более доступным и гибким для разработчиков инфраструктурных решений.
Ключевые факты
- Метод позволяет обновлять токенизатор «на месте» без необходимости полного переобучения модели.
- Инициализация новых эмбеддингов происходит через анализ семантической близости к существующим векторам в пространстве модели.
- Технология сокращает вычислительные ресурсы, необходимые для адаптации LLM под новые языки или доменные области.
- Подход обеспечивает сохранение производительности модели на исходных данных после расширения словаря.
- Решение ориентировано на повышение эффективности дообучения и кастомизации готовых нейросетевых архитектур.