Автор эксперимента предложил метод борьбы с шаблонным стилем генеративных моделей, используя параметр `logit_bias` для принудительного исключения типичных «ИИ-слов». Ограничивая вероятность появления таких выражений, как «delve», «tapestry» или «testament», удалось добиться более естественного звучания текста. Этот подход позволяет гибко настраивать стилистику вывода LLM без необходимости полноценного дообучения модели.
В основе метода лежит манипуляция вероятностями токенов на этапе инференса. Многие современные модели, обученные с использованием RLHF, склонны к использованию предсказуемых, «безопасных» и излишне формальных оборотов, которые пользователи быстро научились распознавать как машинные. Применение отрицательных значений смещения (bias) к списку стоп-слов заставляет модель искать альтернативные лексические конструкции, что делает итоговый результат менее монотонным.
Практическая реализация требует формирования качественного словаря «ИИ-штампов», которые часто встречаются в ответах GPT-4 и других популярных моделей. Хотя этот способ не меняет логику рассуждений, он существенно влияет на «человечность» подачи материала. Метод эффективен для задач, где требуется создание контента, который должен мимикрировать под авторский стиль или избегать узнаваемых паттернов генеративного текста.
Ключевые факты
- Метод использует параметр `logit_bias` в API OpenAI для снижения вероятности выбора конкретных токенов до нуля.
- В список исключений попали слова, характерные для «ИИ-стиля»: «delve», «tapestry», «testament», «unleash», «comprehensive».
- Настройка позволяет принудительно менять лексический состав ответа без изменения системного промпта или архитектуры модели.
- Техника демонстрирует, что узнаваемость ИИ-текстов связана не только с логикой, но и с избыточной частотностью определенных «безопасных» слов в обучающей выборке.