Модель Grok-2 от xAI показала неожиданно высокие результаты в решении задач по формальной математике, сопоставимые с узкоспециализированными инструментами. Исследователи протестировали способность нейросети генерировать доказательства на языке Lean, отметив её умение справляться с комплексными логическими выводами, которые ранее считались сложными для LLM общего назначения без дополнительного обучения.

Автоматическое доказательство теорем традиционно требовало использования специализированных систем, таких как Lean или Isabelle, где малейшая синтаксическая ошибка приводит к провалу верификации. Успех Grok-2 указывает на значительный прогресс в способности моделей понимать формальные языки программирования и следовать строгим правилам логического вывода. Это открывает новые возможности для интеграции ИИ в академические исследования и верификацию программного обеспечения.

Использование LLM в качестве помощников для математиков позволяет ускорить процесс проверки гипотез и написания формализованного кода. Несмотря на то что модели всё ещё могут допускать галлюцинации в длинных цепочках рассуждений, текущие показатели Grok-2 подтверждают эффективность архитектуры при работе с высокоструктурированными данными и строгой логикой.

Ключевые факты

  • Модель Grok-2 успешно справляется с задачами по формализации математических утверждений на языке Lean.
  • Эффективность модели в доказательстве теорем значительно превышает показатели предыдущих версий Grok и многих других LLM общего профиля.
  • Способность к генерации корректного кода для систем автоматической проверки позволяет использовать модель для верификации сложных математических доказательств.
  • Результаты подтверждают потенциал больших языковых моделей в области автоматизированного логического вывода и формальной верификации.