Исследователи представили SCHEDBench — специализированный бенчмарк для оценки способности больших языковых моделей соблюдать строгие логические ограничения в комбинаторных задачах планирования. Инструмент проверяет, насколько точно модели придерживаются заданных условий при изменении формулировок запросов, сравнивая результаты генерации с эталонными решениями, полученными с помощью классических алгоритмических солверов.

В основе SCHEDBench лежат канонические задачи планирования, где критически важно соблюдение жестких правил (например, временных интервалов или ресурсных лимитов). Традиционные методы оценки часто не учитывают, как вариативность естественного языка влияет на способность модели следовать сложным инструкциям. Новый бенчмарк позволяет количественно измерить «верность» (faithfulness) модели — способность сохранять логическую корректность и оптимальность решения независимо от того, как именно сформулировано условие задачи.

Использование SCHEDBench помогает выявить уязвимости LLM в сценариях, где ошибка в интерпретации ограничений приводит к невыполнимым или неоптимальным графикам. Это критически важно для внедрения ИИ в логистику, управление производственными процессами и распределение ресурсов, где точность планирования имеет прямое влияние на операционную эффективность.

Ключевые факты

  • SCHEDBench оценивает точность соблюдения ограничений (constraint faithfulness) в комбинаторных задачах.
  • Бенчмарк использует данные от классических солверов для верификации осуществимости и оптимальности сгенерированных графиков.
  • Тестирование учитывает устойчивость моделей к изменениям в поверхностной форме (surface-form variation) естественного языка.
  • Инструмент предназначен для выявления разрывов между способностью модели к генерации текста и её логической дисциплиной в прикладных задачах.