Система Varto успешно справилась со всеми задачами из математического бенчмарка PutnamBench, используя интерактивный прувер Isabelle. Это достижение демонстрирует способность ИИ-агентов к формальной верификации сложных математических доказательств. Результат подтверждает переход от генерации вероятностных ответов к строгому логическому выводу, что критически важно для надежности математических вычислений и разработки программного обеспечения с гарантированной корректностью.

PutnamBench представляет собой набор задач из престижной математической олимпиады Уильяма Лоуэлла Патнэма. В отличие от стандартных LLM-бенчмарков, где модель должна просто выдать правильный ответ, работа с Isabelle требует построения формального доказательства, которое проверяется компьютером на отсутствие логических ошибок. Varto удалось автоматизировать процесс генерации кода доказательств, который проходит верификацию в среде Isabelle без ручного вмешательства.

Данный успех подчеркивает потенциал интеграции больших языковых моделей с системами формальной верификации. Это направление позволяет преодолеть проблему «галлюцинаций» в математических задачах, так как каждое утверждение модели проходит проверку через математическую логику. Использование Isabelle обеспечивает высокую степень доверия к результатам, что открывает возможности для применения ИИ в задачах, требующих абсолютной точности, таких как криптография или проектирование критически важных систем.

Ключевые факты

  • Varto стала первой системой, решившей все задачи из набора PutnamBench с использованием формальной верификации.
  • В качестве среды для проверки доказательств использовался интерактивный прувер Isabelle.
  • Бенчмарк PutnamBench основан на задачах одноименной студенческой математической олимпиады, известной своей высокой сложностью.
  • Формальная верификация исключает возможность логических ошибок, характерных для стандартных генеративных моделей.