Исследователи представили GAMUT — бенчмарк для оценки полноты фактической информации в длинных текстах, генерируемых LLM. В отличие от существующих методов, сфокусированных на точности утверждений (precision), GAMUT измеряет, насколько полно модель охватывает все необходимые аспекты запроса. Это позволяет выявить пробелы в знаниях и отсутствие ключевых данных, которые часто игнорируются при стандартной проверке галлюцинаций.
Современные системы оценки часто опираются на пайплайны типа «декомпозиция-поиск-верификация», которые эффективно находят ложные утверждения, но не оценивают отсутствие важной информации. Разработчики GAMUT предложили двухуровневую мета-рубрику, которая систематизирует требования к полноте ответа. Такой подход помогает лучше понимать, насколько модель способна предоставлять исчерпывающие ответы в сложных задачах, требующих глубокой проработки темы.
Внедрение подобных метрик критически важно для систем, где пропуск информации так же опасен, как и фактическая ошибка. Использование GAMUT позволяет разработчикам точнее настраивать модели для работы с RAG-системами и сложными аналитическими запросами, где полнота контекста определяет ценность ответа для конечного пользователя.
Ключевые факты
- GAMUT фокусируется на измерении «фактической полноты» (factual completeness), дополняя существующие метрики точности.
- Метод использует двухуровневую систему мета-рубрик для оценки охвата информации в ответах моделей.
- Бенчмарк позволяет выявлять пропуски данных, которые не фиксируются стандартными алгоритмами верификации утверждений.
- Исследование направлено на решение проблемы неполноты ответов в задачах с открытым концом (open-ended generation).