Исследователи представили HalluTruthQA-4K — специализированный корпус данных для оценки точности ответов больших языковых моделей на арабском языке. В отличие от существующих решений, которые дают лишь общую оценку корректности текста, этот набор данных позволяет проводить детальный анализ ошибок, выявляя конкретные фактологические искажения и причины их возникновения в сгенерированных ответах.
Проблема галлюцинаций в арабском сегменте LLM осложняется нехваткой качественных инструментов для верификации фактов. Новый бенчмарк предлагает гранулярный подход: вместо бинарной классификации «верно/неверно» система предоставляет разметку, указывающую на точные фрагменты с ошибками и предоставляющую эталонные данные для сравнения. Это позволяет разработчикам точнее настраивать модели и оценивать их склонность к выдумкам в специфических лингвистических условиях.
Методология включает не только автоматизированные проверки, но и тщательный процесс аннотирования, который учитывает культурные и языковые особенности арабского языка. Такой подход помогает лучше понимать, как именно модели интерпретируют факты и где чаще всего допускают логические или фактические промахи. Наличие структурированного корпуса данных способствует созданию более надежных RAG-систем и чат-ботов, работающих с арабским контентом.
Ключевые факты
- HalluTruthQA-4K содержит 4000 примеров для глубокой проверки фактов в ответах LLM.
- Бенчмарк обеспечивает гранулярную разметку, выделяя конкретные ошибочные сегменты текста, а не весь ответ целиком.
- Инструмент направлен на решение проблемы нехватки ресурсов для верификации контента на арабском языке.
- Корпус включает пояснения причин возникновения ошибок и предоставляет верифицированные фактологические данные для исправления галлюцинаций.