Разработчик применил методы обучения с подкреплением (RL) для дообучения языковой модели, чтобы избавить её от типичных «ИИ-штампов» и избыточности в тексте. Автор сосредоточился на устранении характерных для GPT-4 конструкций, которые делают контент неестественным и перегруженным, добившись более лаконичного и человечного стиля изложения через итеративную оптимизацию предпочтений модели.

Процесс «unsloping» (очистки от слопа) включал создание набора данных с примерами «плохого» и «хорошего» текста, а также использование алгоритма DPO (Direct Preference Optimization) для настройки весов модели. Основная сложность заключалась в том, чтобы сохранить способность модели следовать инструкциям, не превращая её в слишком сухой или непредсказуемый инструмент. В результате удалось существенно снизить частоту использования слов-паразитов, свойственных современным LLM, таких как «delve», «tapestry» или «testament».

Этот подход демонстрирует, как с помощью относительно небольших вычислительных ресурсов можно адаптировать поведение готовых моделей под специфические стилистические требования. Вместо классического SFT (Supervised Fine-Tuning), использование RL позволило модели лучше «почувствовать» разницу между качественным копирайтингом и стандартным выводом нейросетей, который часто воспринимается читателями как шаблонный.

Ключевые факты

  • Использован метод DPO для дообучения модели с целью изменения стилистических предпочтений.
  • Основная цель — удаление избыточных прилагательных и клише, характерных для ответов GPT-4.
  • Модель обучалась на специально подготовленном датасете, где предпочтение отдавалось более прямолинейным и кратким формулировкам.
  • Метод позволил значительно сократить использование «ИИ-маркеров» в тексте без потери логической связности и точности ответов.