Anthropic опубликовала результаты глубокого анализа математических навыков своих моделей, сфокусировавшись на решении задач, связанных с гипотезой Римана. Исследователи протестировали способность Claude 3.5 Sonnet к формализации математических доказательств и поиску ошибок в сложных вычислениях, продемонстрировав, как современные LLM могут выступать в роли ассистентов для профессиональных математиков при работе с фундаментальными проблемами.

В ходе эксперимента модель не просто генерировала текст, а использовала формальный язык Lean для проверки корректности математических утверждений. Это позволяет минимизировать галлюцинации и логические сбои, которые часто возникают при решении задач, требующих многошаговых рассуждений. Использование интерактивных систем доказательств помогает модели придерживаться строгих правил математической логики, что является важным шагом в развитии надежности ИИ в научных дисциплинах.

Исследование подчеркивает сдвиг в использовании ИИ: от простой генерации кода к полноценному участию в исследовательском процессе. Модели обучаются не только предсказывать следующий токен, но и структурировать доказательства, что делает их пригодными для верификации гипотез. Такой подход открывает возможности для автоматизации рутинных этапов математических исследований, где требуется высокая точность и проверка огромных массивов логических цепочек.

Ключевые факты

  • Anthropic использовала модель Claude 3.5 Sonnet для работы с задачами, связанными с дзета-функцией Римана.
  • В качестве инструмента верификации применялся язык формализации математических доказательств Lean.
  • Исследование показало, что интеграция LLM с формальными системами значительно снижает вероятность логических ошибок.
  • Работа демонстрирует потенциал ИИ в качестве полноценного партнера для математиков при поиске доказательств сложных теорем.