Исследователи представили CreditCardQA — специализированный бенчмарк для проверки способностей больших языковых моделей к численному рассуждению на основе реальных договоров по кредитным картам. Набор данных включает 1800 вопросов, охватывающих сложные финансовые условия, такие как начисление процентов, комиссии и графики платежей, что позволяет оценить точность моделей в задачах, требующих строгой логики и работы с финансовыми данными.

В рамках исследования авторы протестировали современные LLM, используя методы Chain-of-Thought (CoT) и Program-of-Thought (PoT). Результаты показывают, что даже продвинутые модели сталкиваются с трудностями при интерпретации запутанных формулировок банковских соглашений, особенно когда требуется выполнение многошаговых вычислений. Использование PoT, при котором модель генерирует программный код для решения задачи, демонстрирует более высокую надежность по сравнению с классическим пошаговым рассуждением на естественном языке.

Создание CreditCardQA подчеркивает важность доменной адаптации моделей для критически важных областей, где ошибки в рассуждениях могут привести к значимым финансовым последствиям для конечных пользователей. Бенчмарк ориентирован на выявление слабых мест в логических цепочках моделей при работе с неструктурированными текстами, содержащими жесткие математические правила и юридические ограничения.

Ключевые факты

  • Набор данных CreditCardQA содержит 1800 вопросов, основанных на реальных документах финансовых организаций.
  • В исследовании сравниваются подходы Chain-of-Thought (CoT) и Program-of-Thought (PoT) для повышения точности ответов.
  • Вопросы включают вариации от первого лица, имитирующие естественные запросы потребителей о комиссиях и платежах.
  • Бенчмарк сфокусирован на проверке навыков численного рассуждения в условиях сложной финансовой документации.