Исследователи из Дартмутского колледжа проанализировали математические навыки Bing Copilot, работающего на базе GPT-4, и выявили критические недостатки в решении задач. Несмотря на продвинутые языковые возможности, модель часто допускает ошибки в базовой арифметике, логических выводах и интерпретации условий, что ставит под сомнение надежность использования LLM в качестве инструментов для точных вычислений без внешней верификации.

В работе детально разбираются примеры, где ИИ демонстрирует «галлюцинации» при выполнении многошаговых вычислений. Авторы отмечают, что модель склонна к правдоподобным, но математически неверным ответам, что особенно опасно в контексте автоматизации процессов, требующих высокой точности. Исследование подчеркивает разрыв между способностью модели генерировать связный текст и её реальной компетенцией в формальных дисциплинах.

Анализ показывает, что даже при наличии доступа к поисковым инструментам, модель не всегда способна корректно агрегировать данные для решения уравнений. Проблема усугубляется тем, что интерфейс чат-бота создает иллюзию экспертности, скрывая ошибки за уверенным тоном изложения. Это требует пересмотра подходов к использованию генеративных моделей в задачах, где цена ошибки критически высока.

Ключевые факты

  • Исследование проведено на базе Bing Copilot, использующего архитектуру GPT-4.
  • Выявлены систематические ошибки в арифметических операциях и логических цепочках.
  • Модель демонстрирует высокую склонность к генерации неверных ответов при усложнении условий задачи.
  • Авторы указывают на фундаментальные ограничения LLM в области формальной математики и символьных вычислений.
  • Результаты работы опубликованы исследователями из Дартмутского колледжа в 2024 году.