Исследователи представили CreativeInstruct — метод обучения, решающий проблему снижения креативности и разнообразия ответов LLM после стандартного SFT. Новый подход позволяет моделям сохранять высокое качество генерации, одновременно повышая вариативность текста. Это критически важно для задач, требующих творческого подхода, таких как написание художественных текстов или сложных сценариев в рамках обучения с подкреплением.
Традиционное обучение по инструкциям часто приводит к «усреднению» ответов модели, делая их предсказуемыми и шаблонными. Метод CreativeInstruct масштабируемо внедряет в процесс дообучения специальные наборы данных, которые обучают модель находить баланс между следованием строгим правилам и генерацией нестандартных, разнообразных решений. Это позволяет избежать деградации творческих способностей, которая обычно наблюдается при попытках повысить точность модели.
Авторы подчеркивают, что предложенный подход применим к широкому спектру архитектур и не требует значительных вычислительных затрат по сравнению с классическим fine-tuning. Результаты экспериментов показывают, что модели, обученные с использованием CreativeInstruct, демонстрируют более высокие показатели в тестах на креативность, сохраняя при этом способность следовать сложным логическим инструкциям без потери качества.
Ключевые факты
- CreativeInstruct решает проблему снижения разнообразия ответов, возникающую после стандартного этапа пост-тренировки LLM.
- Метод фокусируется на балансировке трех метрик: качества, креативности и разнообразия генерации.
- Подход эффективен как для задач с явным требованием креативности, так и для улучшения результатов в обучении с подкреплением (RL).
- Методология является масштабируемой и может быть интегрирована в существующие пайплайны дообучения моделей без существенного усложнения инфраструктуры.