Исследователи обнаружили, что включение большого объема научной литературы в обучающие выборки LLM может снижать качество ответов моделей. Несмотря на высокую плотность знаний в таких текстах, их специфическая структура, сложная терминология и противоречивость данных создают «шум», который затрудняет способность нейросетей к логическим рассуждениям и обобщению информации в общих задачах.

Проблема заключается в том, что научные тексты часто содержат узкоспециализированные формулировки и специфические стилистические обороты, которые не встречаются в повседневном общении. Модели, переобученные на таких данных, начинают имитировать академический стиль, теряя при этом гибкость в ответах на простые запросы. Это явление получило название «отравления» данными, где избыток академического контента приводит к деградации когнитивных способностей ИИ.

Авторы исследования подчеркивают, что качество обучающего датасета важнее его объема. Для достижения оптимальных результатов разработчикам рекомендуется фильтровать научные публикации, отсеивая тексты с низкой цитируемостью или сомнительной методологией, чтобы не засорять веса модели нерелевантными паттернами. Это ставит под сомнение стратегию «чем больше данных, тем лучше» при подготовке моделей общего назначения.

Ключевые факты

  • Исследование показало, что избыток научной литературы в обучающей выборке коррелирует со снижением точности ответов на общие вопросы.
  • Сложная терминология и специфические синтаксические конструкции научных статей негативно влияют на способность модели к естественному общению.
  • Авторы предлагают внедрять более строгие фильтры качества при отборе текстов для претрейна, чтобы избежать «зашумления» знаний.
  • Результаты указывают на необходимость балансировки датасетов между академическими источниками и данными из повседневной коммуникации для сохранения универсальности LLM.