Исследователи представили HalluTruthQA-4K — специализированный корпус данных для оценки точности ответов больших языковых моделей на арабском языке. В отличие от существующих решений, которые дают лишь общую оценку корректности текста, этот набор данных позволяет проводить детальный анализ ошибок, выявляя конкретные фактологические искажения и причины их возникновения в сгенерированных ответах.

Проблема галлюцинаций в арабском сегменте LLM осложняется нехваткой качественных инструментов для верификации фактов. Новый бенчмарк предлагает гранулярный подход: вместо бинарной классификации «верно/неверно» система предоставляет разметку, указывающую на точные фрагменты с ошибками и предоставляющую эталонные данные для сравнения. Это позволяет разработчикам точнее настраивать модели и оценивать их склонность к выдумкам в специфических лингвистических условиях.

Методология включает не только автоматизированные проверки, но и тщательный процесс аннотирования, который учитывает культурные и языковые особенности арабского языка. Такой подход помогает лучше понимать, как именно модели интерпретируют факты и где чаще всего допускают логические или фактические промахи. Наличие структурированного корпуса данных способствует созданию более надежных RAG-систем и чат-ботов, работающих с арабским контентом.

Ключевые факты

  • HalluTruthQA-4K содержит 4000 примеров для глубокой проверки фактов в ответах LLM.
  • Бенчмарк обеспечивает гранулярную разметку, выделяя конкретные ошибочные сегменты текста, а не весь ответ целиком.
  • Инструмент направлен на решение проблемы нехватки ресурсов для верификации контента на арабском языке.
  • Корпус включает пояснения причин возникновения ошибок и предоставляет верифицированные фактологические данные для исправления галлюцинаций.