Исследователи проанализировали способность языковых моделей следовать правилам модальной логики, где выводы зависят от семантических допущений о доступности миров и существовании объектов. Авторы разработали специализированный набор данных, чтобы проверить, опираются ли модели на заданную логическую семантику или на заученные паттерны рассуждений, что критически важно для понимания глубины логического мышления современных ИИ-систем.

В работе подчеркивается, что одна и та же логическая формула может давать разные результаты в зависимости от выбранной модальной системы. Традиционные бенчмарки часто не учитывают этот нюанс, позволяя моделям «угадывать» ответы на основе статистических закономерностей, а не строгого следования формальным правилам. Использование парных задач позволило отделить истинное понимание семантики от поверхностного копирования логических конструкций.

Результаты показывают, что даже продвинутые модели сталкиваются с трудностями при переключении между различными семантическими интерпретациями одних и тех же формул. Это указывает на то, что текущие методы обучения LLM не гарантируют устойчивого владения формальной логикой, что ограничивает их применение в задачах, требующих строгого соблюдения заданных правил и условий.

Ключевые факты

  • Исследование сфокусировано на разграничении между заученными логическими паттернами и следованием формальной семантике.
  • Разработан новый набор данных, состоящий из парных задач модальной логики для тестирования моделей.
  • Выявлено, что модели часто демонстрируют неспособность адаптироваться к смене семантических правил в рамках одной и той же логической структуры.
  • Работа подчеркивает необходимость разработки более глубоких методов оценки логического вывода, выходящих за рамки стандартных тестов на эрудицию.