Исследователи проанализировали причины низкой эффективности LLM в задачах табличного прогнозирования по сравнению со специализированными моделями градиентного бустинга. Основная проблема заключается в неспособности трансформеров эффективно обрабатывать гетерогенные табличные данные и извлекать из них закономерности, что ограничивает их применение в классических задачах машинного обучения, требующих высокой точности на структурированных наборах данных.

Авторы работы указывают, что архитектура LLM, оптимизированная для обработки последовательностей текста, плохо адаптируется к табличным форматам. В отличие от моделей типа XGBoost или LightGBM, которые напрямую работают с признаками и их статистическими взаимосвязями, языковые модели пытаются интерпретировать данные через токенизацию, что приводит к потере информации и неэффективному использованию контекстного окна.

Исследование подчеркивает, что даже при использовании продвинутых методов промпт-инжиниринга или дообучения, LLM часто не могут достичь сопоставимых результатов на табличных бенчмарках. Это ставит под сомнение универсальность текущих архитектур для всех типов данных и указывает на необходимость гибридных подходов, где табличные данные обрабатываются специализированными алгоритмами, а LLM используются лишь для интерпретации результатов или генерации отчетов.

Ключевые факты

  • Исследование выявило фундаментальное различие в эффективности обработки данных между трансформерами и алгоритмами градиентного бустинга.
  • Основным препятствием для LLM является неспособность эффективно кодировать и интерпретировать гетерогенные признаки в таблицах.
  • Токенизация табличных данных приводит к значительному росту вычислительных затрат при снижении точности прогнозов.
  • Специализированные модели (XGBoost, CatBoost) остаются стандартом индустрии для табличных данных, превосходя LLM по метрикам качества и скорости обучения.